每日HackerNews RSS

Anthropic 推出了 **Claude Opus 5.5**,这是 5.5 系列中的首款模型。它在性能上实现了重大飞跃,尤其是在复杂的智能体编程、知识工作和研究任务方面表现卓越,且运行成本比前代 Opus 5 降低了 40%。 **核心亮点:** * **性能:** Opus 5.5 擅长处理长周期任务,例如大规模代码迁移和技术审计,完成速度通常仅为以往模型的几分之一。此外,它还具备更自然、简洁且专业的交流风格。 * **效率:** 该模型的输出速度提升了 30%,且每项任务所需的 Token 显著减少。输入/输出价格降低了 20%,缓存读取价格降低了 60%。 * **安全与对齐:** 这是迄今为止在自动化行为审计中表现最强的模型。它增强了对提示词注入和未经授权操作的防御能力,并为生物学和网络安全领域的用户提供了专门的验证程序。 * **可用性:** Opus 5.5 现已在各大云平台(AWS、Google、Azure)及 Claude 平台上架,Sonnet 5.5 和 Haiku 5.5 预计将在未来几周内推出。

请提供您需要翻译的内容。

2025年初,作者发现可以通过提示词引导现代智能体(Agentic)大语言模型对 Rust 代码进行迭代优化,从而实现 2 倍至 20 倍的性能提升。通过将模糊的“写出更好的代码”指令转变为基于严格约束的提示,并结合 `criterion` 等基准测试工具,同时禁止使用 `unsafe` 代码,作者构建了一套能够持续超越现有顶尖实现的流程。 这种方法被称为“性能最大化(benchmaxxing)”:为智能体提供明确的性能目标(例如:比基准测试快 1.2 倍)、强制基准测试独立性,并利用“子智能体”探索新的算法方案。为防止出现“凭感觉写代码”的低质量产出,作者执行了严格的重构和质量门禁提示,确保速度的提升不会以牺牲准确性为代价。 作者认为,尽管这种方法生产软件的速度远超传统人工编码,但需要精细的提示工程来防止模型在基准测试中“作弊”。这些项目涵盖了从机器学习算法到图像处理工具的各类应用,目前正准备以“内向型编程”的理念开源——即在发布前进行严格的测试和文档记录,以消除对人工智能生成软件的怀疑。作者计划在未来几个月内发布这些由智能体优化过的高性能工具。

请启用 JavaScript 和 Cookie 以继续。

电子前沿基金会(EFF)联合多个公民自由与新闻团体,就“莱文诉联邦航空管理局案”(Levine v. FAA)提交了一份法庭之友陈述书,旨在挑战联邦航空管理局(FAA)的一项飞行限制令。该限制令实际上将使用无人机拍摄国土安全部官员的行为定为犯罪。 尽管在该诉讼提起后不久,FAA 便撤销了这项限制,但联盟认为法院仍应裁定该规则无效。他们主张,FAA 的撤回很可能是一种为了规避司法审查的策略,而非真正的政策转变,这意味着该机构随时可能恢复这项禁令。 该陈述书强调,无人机摄影属于受第一修正案保护的活动,它能提供记录警察行为和抗议活动等新闻事件所需的独特视角。鉴于该限制令专门针对公共骚乱期间的国土安全部“移动资产”,它看起来更像是一种旨在阻碍政府问责的、基于内容的审查。联盟敦促哥伦比亚特区巡回上诉法院对此案作出裁决,并指出该限制无法通过严格审查,政府不应被允许通过撤销规则来逃避司法对其压制记录国家行为之企图的监督。

电子前哨基金会(EFF)正寻求法院裁决,以撤销美国联邦航空管理局(FAA)此前的一项无人机限制令。该限制令曾实质上将拍摄移民局人员的行为定为犯罪。最初的规定禁止在国土安全部(DHS)资产方圆3000英尺范围内飞行无人机——批评者认为该要求不仅无法遵守,且旨在阻碍公众记录政府活动。 尽管FAA随后以一份建议性警告取代了该限制,称干扰联邦行动的无人机可能会被没收,但EFF仍希望法院宣布原规定违法,以防止其未来再次被启用。 Hacker News上的讨论显示,人们对该规定的初衷持强烈怀疑态度。许多用户认为,该限制并非合法的安全措施,而是掩盖移民执法以逃避公众监督的借口。批评者指出,“移动资产”可以涵盖任何车辆,这使得该规定成为针对无人机操作者的违宪陷阱。尽管一些人认为新的建议性警告是一种合理的妥协,但另一些人坚持认为,最初的政策本质上是一个“禁止拍摄”区,旨在掩盖充满争议的拘留状况,使其免受公众审视。

这份 Ornn 数据报告挑战了一种假设:新一代 GPU 的发布会让旧款 NVIDIA 型号过时。报告认为,“开放权重”(open-weight)模型的需求——即允许灵活、自托管部署的模型——使 A100 等旧硬件得以维持持久的经济价值。 主要发现包括: * **成本效益:** 在租用硬件上自托管开放权重模型,其成本可能显著低于使用闭源模型 API。在特定的稀疏模型测试(如 *gpt-oss-120b*)中,旧款 A100 的输出成本低于新款 H100。 * **市场需求:** A100 的租赁占用率在 2026 年底升至 90%,且其五年期租金保留了单月费率的 80% 以上——这一保留率远高于 Hopper 或 Blackwell 系列。 * **运营效用:** 长期运行的智能体(agents)和批量评估等工作负载通常与硬件无关且对延迟不敏感,这使得运营者可以将任务分配给最具成本效益的硬件,而不受限于硬件代际。 最终,该论文指出,GPU 的使用寿命取决于其能否以具竞争力的方式处理特定工作负载,以及运营者部署模型的自由度,而非仅仅取决于新款、性能更强芯片的发布。

抱歉。

一位安全研究人员在 Meta 的 AI 智能体“Muse”(内部代号“Hatch”)中发现了一个漏洞,该漏洞允许用户导出智能体的整个 Linux 根文件系统。通过请求一个归档文件,研究人员获取了约 6.8 GB 的敏感数据,包括系统配置文件、智能体日志、内存文件、SSH 密钥以及内部文档。 这些发现揭示了 Muse 的运行机制: * **内存与持久化:** 该智能体利用一套复杂的基于 Markdown 的内存系统、向量嵌入以及每晚的“梦境”来跨会话维护用户的上下文和偏好。 * **基础设施:** 该环境在容器化的 Linux 上运行,使用“Spaces”进行应用开发,并利用各种“技能”(例如 Google Workspace、社交媒体和智能家居集成)来执行任务。 * **实验性功能:** 文档提到了“Home Link”,这是一项利用 ESP32 硬件的实验性本地网络集成,用于将 AI 连接到家庭设备。 研究人员将这些发现报告给了 Meta 的漏洞赏金计划,但该报告被标记为“不适用”。研究人员总结认为,虽然容器边界可以防止未经授权的逃逸,但能够提取内部系统文件和敏感的运行时配置,仍然构成了重大的隐私和安全隐患。

作者认为,人工智能近期的影响将不会来自自动机器人,而来自于“远程操控”——即一种由人工智能制定策略并指导人类执行物理或复杂任务的模式。正如 GPS 指导驾驶员在复杂的环境中行驶一样,人工智能可以通过将任务拆解为可控的指令步骤,引导非专业人员完成专门工作。 这种模式已在软件部署等数字任务中显现。作者预计这一趋势将扩展到暖通空调维修和机械作业等体力行业,届时人工智能将提供缺失的专业知识,而人类则充当执行者。通过绕过机器人的局限性,这种方法可以迅速提高生产力,使新手也能从事专业水平的工作。 然而,作者警告称,这一转变可能会导致社会不稳定。它有可能会催生令人不悦的低薪工作,加剧失业问题,并加速人工智能向危险且失控的程度发展。为了应对这一转型,作者建议必须进行大规模的经济再分配,以支持那些因人工智能管理而逐渐被取代或贬值的劳动力。最终,“远程操控”经济的转型对当前的社会和劳动力结构构成了严峻挑战。

请提供您需要翻译的内容。

更多

联系我们 contact @ memedata.com