404 Media 的一项调查证实,亚马逊正在大量购入纸质书用于训练其人工智能模型,并在此过程中销毁这些实体书。调查人员通过 AirTag 追踪货物,将书籍的去向锁定在了位于拉斯维加斯的一个名为“VGT3”的亚马逊专业设施中。
该站点的员工证实,他们的主要工作是切开书脊,以便进行高速扫描并录入数字化系统。这一操作与独立书商的反馈相吻合——书商们发现,近期针对 2022 年以前出版书籍的大批量、不计价格的订单异常激增。人工智能公司非常看重这些旧书,因为它们包含独特的、由人类创作的内容,这些内容在互联网上难以获取,且不存在被人工智能生成内容污染而导致“模型崩溃”的风险。
尽管亚马逊声称购书是为了改进其产品和服务,但这一行为凸显了人工智能训练过程的激进与资源密集型本质。批评人士指出,这一过程抛弃了实体书的历史、智力与情感价值,将复杂的人类著作仅仅简化为大语言模型的数据点。
1998 年至 1999 年间,20 岁的 Oscar Toledo G. 为一款基于 Am29000 处理器的自制计算机开发了一套完整的 32 位软件生态系统。在那个“千年虫”问题引发广泛担忧、互联网正迅速扩张的时代,Toledo 从手动编写机器码转向构建定制的 C 语言编译器、汇编器和文本编辑器。
该项目最终发展成一个复杂的窗口化操作系统(“Sistema Fénix”),并包含 PCB 编辑器和网页浏览器(“Biyubi”)等应用程序。为了在 512 KB 内存的限制下实现这些功能,Toledo 采用了基于 ROM 执行和优化内存管理等创造性技术。
数十年后,Toledo 通过模拟 Am29000 硬件并修补网络服务,成功让这一环境重现,使其 1999 年的浏览器得以连接现代互联网。他通过对早期的软盘和 CD 备份进行逆向工程,修复了自己的早期作品,展现了在一年内编写超过 5 万行源代码的惊人壮举。该项目依然是 20 世纪 90 年代末独创精神与技术飞速发展的见证。