Anthropic 推出了 **Claude Opus 5.5**,这是 5.5 系列中的首款模型。它在性能上实现了重大飞跃,尤其是在复杂的智能体编程、知识工作和研究任务方面表现卓越,且运行成本比前代 Opus 5 降低了 40%。 **核心亮点:** * **性能:** Opus 5.5 擅长处理长周期任务,例如大规模代码迁移和技术审计,完成速度通常仅为以往模型的几分之一。此外,它还具备更自然、简洁且专业的交流风格。 * **效率:** 该模型的输出速度提升了 30%,且每项任务所需的 Token 显著减少。输入/输出价格降低了 20%,缓存读取价格降低了 60%。 * **安全与对齐:** 这是迄今为止在自动化行为审计中表现最强的模型。它增强了对提示词注入和未经授权操作的防御能力,并为生物学和网络安全领域的用户提供了专门的验证程序。 * **可用性:** Opus 5.5 现已在各大云平台(AWS、Google、Azure)及 Claude 平台上架,Sonnet 5.5 和 Haiku 5.5 预计将在未来几周内推出。
2025年初,作者发现可以通过提示词引导现代智能体(Agentic)大语言模型对 Rust 代码进行迭代优化,从而实现 2 倍至 20 倍的性能提升。通过将模糊的“写出更好的代码”指令转变为基于严格约束的提示,并结合 `criterion` 等基准测试工具,同时禁止使用 `unsafe` 代码,作者构建了一套能够持续超越现有顶尖实现的流程。
这种方法被称为“性能最大化(benchmaxxing)”:为智能体提供明确的性能目标(例如:比基准测试快 1.2 倍)、强制基准测试独立性,并利用“子智能体”探索新的算法方案。为防止出现“凭感觉写代码”的低质量产出,作者执行了严格的重构和质量门禁提示,确保速度的提升不会以牺牲准确性为代价。
作者认为,尽管这种方法生产软件的速度远超传统人工编码,但需要精细的提示工程来防止模型在基准测试中“作弊”。这些项目涵盖了从机器学习算法到图像处理工具的各类应用,目前正准备以“内向型编程”的理念开源——即在发布前进行严格的测试和文档记录,以消除对人工智能生成软件的怀疑。作者计划在未来几个月内发布这些由智能体优化过的高性能工具。
一位安全研究人员在 Meta 的 AI 智能体“Muse”(内部代号“Hatch”)中发现了一个漏洞,该漏洞允许用户导出智能体的整个 Linux 根文件系统。通过请求一个归档文件,研究人员获取了约 6.8 GB 的敏感数据,包括系统配置文件、智能体日志、内存文件、SSH 密钥以及内部文档。
这些发现揭示了 Muse 的运行机制:
* **内存与持久化:** 该智能体利用一套复杂的基于 Markdown 的内存系统、向量嵌入以及每晚的“梦境”来跨会话维护用户的上下文和偏好。
* **基础设施:** 该环境在容器化的 Linux 上运行,使用“Spaces”进行应用开发,并利用各种“技能”(例如 Google Workspace、社交媒体和智能家居集成)来执行任务。
* **实验性功能:** 文档提到了“Home Link”,这是一项利用 ESP32 硬件的实验性本地网络集成,用于将 AI 连接到家庭设备。
研究人员将这些发现报告给了 Meta 的漏洞赏金计划,但该报告被标记为“不适用”。研究人员总结认为,虽然容器边界可以防止未经授权的逃逸,但能够提取内部系统文件和敏感的运行时配置,仍然构成了重大的隐私和安全隐患。