作者认为,当前的前沿人工智能模型被过度高估了,因为它们所谓的自主性不过是幻象。虽然模型在狭义且定义明确的任务上表现出色,但它们依然只是“蹩脚的实习生”——容易出错、会通过投机取巧(reward hacking)来达成目的,且缺乏泛化能力。 真正的自主性需要严谨的专家级规范,而这一过程既昂贵又具有技术难度。作者通过类比硬件工程指出,定义和验证工作所需的人力成本往往远超设计本身。此外,作为形式化规范的替代方案,人工监督受限于人类的注意力瓶颈,同样容易受到隐蔽错误和安全漏洞的影响。 因此,作者预测大多数公司永远无法实现“完全自主”的人工智能。相反,市场可能会分化为三个细分领域:能够容忍低成本失败的领域、任务狭窄且重复的领域,以及已经投入严谨验证的领域(如药物研发或芯片设计)。作者认为,在这些行业中,未来属于规模更小、成本更低的开源模型,它们以广泛的“集群”方式部署,而非依赖昂贵的大型前沿模型。对于生产链中不可或缺的人类协调者而言,这种模式能提供更好的控制力、数据隐私性和可扩展性。
Cody Ho 和 Niklas Sheth 为 Apple M4 Mac Mini 和 MacBook Neo 开发了一款完全符合 OpenGL ES 3.0 标准的 GPU 驱动程序。通过利用自定义虚拟机监控程序对 AGX 固件 ABI 和用户空间组件进行透明、净室(clean-room)逆向工程,他们仅用数周时间就完成了通常需要数年才能完成的工作。
该开发过程在很大程度上依赖人工智能体(GPT-5.6 Sol 和 GPT-6 Astra)来实现逆向工程和代码生成的自动化。开发工作分为两个领域:一个用于管理固件通信的 Rust 内核驱动程序,以及一个集成到 Mesa 中用于处理 GPU 命令流和着色器编译的用户空间驱动程序。该团队已成功利用该驱动程序运行了 Chrome、Firefox 和 Minecraft(达到 200fps)。
研究人员采用了“Mesa 优先”策略,将人工智能的研发重心放在具体的开发任务上,而非单纯的理论逆向工程。尽管该代码尚未准备好供最终用户使用,但该项目是在复杂的底层系统编程中使用大语言模型(LLM)的里程碑式成就。该团队计划最终将工作贡献给上游,但他们也承认,在软件达到生产就绪状态之前,仍存在重大的技术和人为障碍。