每日HackerNews RSS

Prime Intellect 推出了 **Prime Agent**,这是一个开源的自我提升型编码工具框架,旨在突破静态、人工设计智能体架构的局限。与传统框架不同,Prime Agent 将模型视为一个递归、自适应的系统,构建在两个核心抽象之上: * **递归语言模型(RLM):** 将上下文视为变量,并将子智能体委托视为持久化 IPython REPL 中的程序函数调用。这实现了深度嵌套的编排和高效的内存管理。 * **持续进化工具(Continual Harness):** 允许智能体将其自身的提示词、技能、记忆和子智能体视为可创建、读取、更新或删除(CRUD)的对象。通过 `/refine` 流水线,智能体能根据过去的成功与失败自主提升自身性能。 Prime Agent 具备后台守护进程,支持持久会话、智能体间通信以及长周期任务的自主执行。在评估中,Prime Agent 在 ARC-AGI-3 和复杂编码任务等既有模型及基准测试中,表现出与顶尖水平相当甚至更优的性能,且通常以更少的 Token 用量获得更高的分数。通过实现模型与工具的协同学习,Prime Agent 旨在推动行业向直接的程序化控制转变,以不断演进的自主架构取代僵化且依赖提示词的设计。

Hacker News 上关于“Prime Agent”(一种自我改进型递归语言模型,RLM)的讨论,既体现了技术上的质疑,也引发了更广泛的哲学思考。 批评者认为,该项目的代码库臃肿不堪,充斥着 10,000 行的庞大文件和过多的 switch 语句,这与高效、自我改进型人工智能的目标背道而驰。许多用户指出,当前的基础模型已经足够强大,无需复杂的“框架”;简单的利用 Markdown 文件进行上下文管理往往就已足够。 讨论还涉及了该项目的命名,这一名称参考了经典科幻中篇小说《Prime Intellect 的变形》(The Metamorphosis of Prime Intellect)。参与者就书中对通用人工智能(AGI)的高概念探讨及其具争议性的图形化内容展开了辩论。 最后,用户对该项目在 ARC-AGI-3 测试中报告的基准数据提出了质疑。观察人士认为,自我改进型智能体可能通过过度重试或硬编码违背了基准测试中“少样本(few-shot)”的限制,这凸显了为不断演进的自主智能体建立标准化评估体系所面临的持续挑战。总体而言,尽管社区认为这种“递归”方法很有趣,但许多人将其视为一种进化步骤,而非革命性的突破。

排版常被视为纯粹的功能性存在,但它本质上是富有情感的。我们或许认为只有在排版难以阅读时才会注意到它,但每一款字体的选择都在传达某种特定的情绪——从编程中等宽字体所呈现的结构化实用性,到《银翼杀手》片头字幕所蕴含的叙事张力,皆是如此。 作者指出,在如今的人工智能辅助创作时代,许多用户将“完成任务”误认为是真正的设计。人工智能虽然能够构建出实用的工具,却往往忽略了那些能将作品从“合格”提升至“卓越”的细微之处。作者通过对比《银翼杀手》试映版中平庸的“Impact”字体与成片中深思熟虑的“Goudy Oldstyle”字体,阐明了品质往往存在于最后那 10% 的努力之中。 归根结底,设计不仅关乎实用,更是无数细小且精益求精的决策之结晶。无论是在软件还是电影中,这些细节累积起来,构成了产品的“声音”。伟大的设计不仅是被看见,更是被感知,因为它反映了创作者的意图与人文精神。

Hacker News 上一场关于《银翼杀手》片头字幕的讨论,演变成了一场关于艺术造诣本质及电影配乐影响力的广泛探讨。 用户们分析了开场字幕的技术排版与设计选择,指出小型大写字母、长破折号及布局等元素如何营造了影片的氛围。许多评论者强调,由范吉利斯(Vangelis)创作的传奇配乐——在未用乐谱的情况下凭听觉谱写——才是开场沉浸感的真正基石。 对话触及了几个反复出现的主题: * **“人性”元素:** 讨论中出现了关于文章本身是否由 AI 生成的争论,凸显了大众对“大语言模型式”写作惯用语日益增长的敏感度。 * **遗产与影响:** 参与者讨论了《银翼杀手》如何确立了一种视觉标准,使得后来的科幻作品(如《神经漫游者》)不得不小心避开,以免显得落入窠臼。 * **直觉与训练:** 该帖赞扬了汉斯·季默(Hans Zimmer)、库尔特·科本(Kurt Cobain)和范吉利斯等创意人士,他们凭借直觉而非正统音乐训练取得了伟大成就,并认为技术层面的掌握次于“情感”的传达。 最终,各方共识将《银翼杀手》定性为一次罕见的、多方协作的“完美风暴”,其声效、视觉与时机的融合造就了一部恒久的文化经典。

NVIDIA 的新款 88 核“Vera”服务器 CPU 采用“Olympus”Arm v9.2 架构,是一款高性能单体芯片,具备先进的数值预测、图形预取器以及高达 1.2 TB/s 的 LPDDR5X 内存子系统。早期有限的测试表明,该架构确实实力雄厚,在某些指标上很可能超越了当前的 x86 竞争对手。 然而,随发布会一同公布的 45 页白皮书因其误导性的营销手法而受到猛烈抨击。该白皮书将 x86 SMT(同步多线程)和芯粒(Chiplet)架构等常见的行业做法刻画为固有缺陷,以此人为地提升 Vera 的形象。文中频繁歪曲竞争对手的配置,使用模糊或非标准的“智能体”(agentic)基准测试,并依赖非科学的象形图而非可复现的数据。 尽管该硬件本身似乎是 Arm 服务器技术的一次重大飞跃,但 NVIDIA 试图强行构建超越 x86 的叙事,却缺乏自身数据的支持。归根结底,该芯片令人印象深刻的技术规格足以自证实力;而这种激进且往往站不住脚的营销,反而可能分散人们的注意力,甚至损害这款本应非常出色的硅片声誉。要验证 Vera 对阵现代 EPYC 和至强处理器的真实性能,仍需进行独立的、不受限制的测试。

最近,《Chips and Cheese》对英伟达(NVIDIA)“Vera”CPU白皮书的分析在 Hacker News 上引发了对该公司营销宣传的质疑。 主要的批评集中在英伟达选择的“代理基准测试”(agentic benchmarks)上,这些测试仅使用了繁重的编译器工作负载(如 GCC、LLVM 等)。批评者认为,这是一个经过精心挑选的子集,无法代表现实世界中人工智能代理常见的各种数据库密集型或多媒体任务。一些参与讨论的人认为,这延续了英伟达一贯的做法,即通过可能具有误导性的营销,将其硬件呈现为最理想的状态。 除了基准测试的完整性,讨论还涉及了 CPU 市场的更广阔背景。尽管一些评论者对技术设计印象深刻,但其他人则认为该白皮书纯属“企业营销”,并指出竞争对手 AMD 已经发布了高性能芯片。此外,精通技术的用户对该芯片依赖值猜测(value speculation)带来的安全性表示担忧;而另一些人则指出,英伟达的目标是打造一款专门的控制芯片,以最大限度地减少其 AI 集群中的 GPU 瓶颈,而非直接参与通用 CPU 市场的竞争。

由于对谷歌日益严格的限制、侵入式追踪以及 AOSP 的衰落感到失望,作者决定将手中的 Fairphone 4 从 Android 系统迁移到 Linux。 在尝试了多个移动端 Linux 发行版后,作者最终选择了 SailfishOS,并对其基于手势的导航、纯正的 Linux 使用体验以及通过 SSH 管理设备的能力表示赞赏。然而,这次迁移并非一帆风顺。SailfishOS 在 Fairphone 上存在库版本过旧以及 Waydroid 支持失效的问题;而作为主要替代方案的 Ubuntu Touch,则缺乏必要的易用性功能和成熟的原生应用。 由于某些关键服务(如银行、政府验证和打车软件)仍依赖 Android,作者保留了一台备用手机作为“热点”设备来处理这些特定任务。尽管面临技术障碍且需要携带备用机,作者依然致力于 Linux 生态,甚至考虑未来更换为 Jolla 官方设备。作者将此次迁移视为一个持续的过程,旨在减少对 Android 的依赖,并推动实现更大的数字主权。

这篇 Hacker News 讨论探讨了从 Android/iOS 转向移动 Linux 所面临的挑战,反映了人们对“双头垄断”以及谷歌对 Android 生态系统日益加强的控制所产生的普遍不满。 **主要观点包括:** * **Google Play 服务是主要障碍:** 用户认为 Android 的核心操作系统本身性能尚可,但 Google Play 服务已成为一种无法避开的“闭源”层,强制进行追踪并阻碍了用户对设备的真正掌控。 * **“围墙花园”问题:** 许多核心服务(如银行、政府电子证件和交通应用)依赖于特定的专有应用程序,这些应用利用 SafetyNet 或 Play Integrity 检测并拦截非标准设备或已获取 Root 权限的设备。这使得许多人难以将 Linux 手机作为“主力机”使用。 * **硬件与用户体验差距:** 除了软件之外,Linux 手机在相机优化、电源管理和专有键盘“黑科技”(如预测文本)方面仍落后于主流设备。 * **拟议解决方案:** 建议包括在处理日常任务时使用“功能机”,同时保留一台 Android 设备处理受限应用;或是向政府施压,强制推行开放的、基于 Web 标准的银行服务。 * **“折腾者”的视角:** 尽管一些发烧友在 postmarketOS 或 Librem 5 等项目中取得了成功,但大多数人认为,对于普通消费者而言,目前仍无法获得真正可替代移动双头垄断的方案。

现代软件开发在 AI 智能体的推动下,已从线性的任务完成方式转变为并行工作流。这种演变使得传统的标签页界面因频繁的上下文切换而变得低效且令人疲惫。 为了解决这一问题,FlutterFlow 团队开发了 **Campus**,这是一个面向 macOS 的协作式无限二维画布。与仅能展示静态截图的白板工具不同,Campus 直接在画布上承载“实时”应用程序,例如功能终端、浏览器和代码编辑器。这种空间化的处理方式利用了人类的“记忆宫殿”原理,允许用户按功能而非类型来组织工作,从而显著降低切换任务时的认知负荷。 Campus 专为协作式多用户环境而设计。它采用“本地优先”、注重隐私的架构,使工作内容留存在您的设备上,并支持可选的点对点共享以实现实时协作。它甚至还具备“茶水间”风格的阅后即焚聊天功能,以促进远程团队成员之间的人际交流。 Campus 可免费使用,代表了一种向更具整体性、沙盒式工作空间转变的趋势。未来的更新将引入基于 WASM 的扩展、移动端支持以及 3D 功能。现可通过 [campus.flutterflow.io](https://campus.flutterflow.io) 获取。

本网站正在使用安全服务来保护自身免受网络攻击。您刚才的操作触发了安全防御机制。触发此拦截的原因可能有多种,包括提交了特定的词汇或短语、SQL 命令或格式错误的数据。

这份 Hacker News 讨论帖探讨了古德哈特定律(Goodhart's Law)对人工智能基准测试的侵蚀,即当一项指标成为目标时,它就不再是一个好的衡量标准。 参与者认为,公开的 AI 基准测试正变得越来越不可靠,因为模型要么在这些测试集上进行过训练,要么经过优化以“作弊”获取高分。许多用户指出,近期的文章——包括被讨论的那一篇——表现出明显的“AI 味”或机械的修辞风格,导致人们对 AI 生成内容的信任度下降。 讨论强调了几个关键主题: * **钻系统空子:** 随着基准测试成为公开的考核目标,开发者往往更关注分数而非实际能力,这与企业 KPI 管理中的历史性问题如出一辙。 * **私有基准测试的兴起:** 许多人认为,使用私有且频繁更新的数据集是避免污染的唯一途径,尽管维护成本高昂。 * **效用下降:** 一些评论者认为标准的基准测试已失去意义。他们主张进行实用的、基于成本和特定任务的测试,并指出“最好”的衡量标准往往是用户内部专有的标准。 归根结底,大家的共识是,只要激励机制依然优先考虑高分,基准测试就将始终存在内在缺陷。

请启用 JavaScript 和 Cookie 以继续。

Javier Sagredo 发布了 **Sula**,这是一个使用 **Scryer Prolog** 实现的 Gemini 协议服务器。 该项目受到了 Prolog 社区的积极关注,特别是开发者“triska”指出,为 Sula 进行的几项优化目前正等待合并至 Scryer Prolog 主仓库。鼓励有兴趣的贡献者查看相关的开放合并请求(PR #3379、#3383、#3387 和 #3390)并参与讨论。 此外,欢迎该语言的爱好者参加定于 2026 年 10 月 24 日至 25 日在奥地利维也纳举办的 **Scryer Prolog 聚会**。

Meta 推出了 **Muse Code (beta)**,这是一款基于终端的编程智能体,由其最新的 **Muse Spark 1.2** 模型驱动。Muse Code 专为复杂的软件工程而设计,通过一套协调一致的持久化异步子智能体系统,实现对整个代码库的规划、编写和验证。 主要功能包括: * **弹性运行时:** 本地事件日志确保操作支持断点续传,使智能体能够在崩溃后准确恢复执行长期任务。 * **高级规划:** 内置工具(如 `/plan`、用于压力测试的 `/grill` 以及 `/goal`)有助于管理复杂的多步骤项目。 * **性能优化:** Muse Spark 1.2 与 Muse Code 联合训练,特别增强了处理长周期任务的能力,例如全代码库生成和迭代调试。 在近期的一项内核优化案例研究中,该智能体通过超过 1000 次工具调用,自主提升了 NVIDIA GPU 内核的性能。Muse Code 现已在 macOS 和 Linux 上可用,Muse Spark 1.2 模型也可通过 Meta Model API 获取。

Meta 发布了专注于编程的 AI 模型 **Muse Spark 1.2**,以及配套的开发工具 **Muse Code**。此次发布的一大亮点是其激进且透明的定价策略:用户可以选择“贡献者”层级(允许 Meta 使用其数据进行训练),从而获得比标准 API 费率低 10 到 20 倍的折扣。 Hacker News 社区对此反应两极分化: * **定价与效用:** 许多开发者认为这种深度折扣(与 DeepSeek 具有竞争力)以及透明的“以隐私换价格”模式非常有吸引力。部分用户对该模型的速度和视觉能力表示赞赏。 * **信任与隐私:** 社区对 Meta 的数据处理惯例仍持深度怀疑态度。批评者认为,无论合同如何规定,Meta 的历史记录使其难以被信任;还有人担心,即便是“不参与训练”的层级也可能无法保障数据隐私。 * **市场定位:** 社区讨论了 Meta 基准测试的有效性,指出该公司避免了与“Sol”等顶级模型进行直接对比。另一些人质疑推出另一个专有编程代理的必要性,认为大多数开发者对 Claude 或 Codex 等现有工具已经感到满意。 * **访问限制:** 用户对该工具的区域可用性(仅限美国)以及必须通过 Meta 关联账号登录的要求表示不满。

Proxmox Virtual Environment (VE) 9.2 已正式将其支持范围从 x86-64 扩展至 64 位 ARM (arm64/aarch64)。该版本基于 Debian 13.5 构建,并采用了与 x86-64 版本相同的技术栈(包括 QEMU 11.0 和 ZFS 2.4),是一个完全支持的生产版本,而非技术预览版。 **主要亮点:** * **硬件支持:** 正式支持 NVIDIA Grace Hopper 和 Vera 平台。其他基于 UEFI 的 ARMv9-A(及大多数 ARMv8-A)硬件在“尽力而为”的基础上提供支持。不支持仅使用设备树(Device-tree)的系统,例如树莓派(Raspberry Pi)。 * **统一生态:** 与 x86-64 版本共享相同的代码库、发布周期和企业存储库。 * **架构说明:** 客户机必须在架构匹配的节点上运行;x86-64 与 arm64 之间无法进行在线迁移。所有 arm64 上的虚拟机必须通过 UEFI (AAVMF) 引导。 * **许可授权:** 可通过 Proxmox 销售团队获取 arm64 版本的企业支持和订阅服务。 这一里程碑版本是与 NVIDIA 紧密合作开发的,使 Proxmox 能够在不同 CPU 架构间提供一致的管理体验,并计划根据企业需求扩展平台支持。

抱歉。

更多

联系我们 contact @ memedata.com