每日HackerNews RSS

GPT-6 Astra 的表现呈现出两极分化:它在编程任务中表现卓越,但在通用智能方面表现参差不齐。 **编程代理指标:** Astra 表现极为突出,足以比肩 Fable 5 和 Claude Opus 5 等顶级竞品。其成功得益于巨大的 Token 使用效率提升——相较于 GPT-5.6 Sol,其 Token 用量减少了多达 70%。因此,它在成本效益方面处于领先地位,以相近的价格提供了优于前代产品的性能。 **智能指标:** 其表现更为复杂。尽管 Astra 在整体智能评分上与 GPT-5.6 Sol 持平,但由于基础价格上涨了 2.5 倍,导致其单项任务成本增加了 75%,这抵消了它在 Token 效率上 10% 的提升。值得注意的是,Astra 显著降低了幻觉率(降至 51%),并在复杂的长跨度知识工作(AA-Briefcase)中表现出强劲增长。然而,它在其他基准测试中出现了倒退,例如 GDPval-AA v2 和特定的领域推理任务。 总的来说,GPT-6 Astra 代表了编程效率和可靠性方面的一次重大飞跃,但其高昂的定价使其相比前代产品平衡且高性价比的表现,成为了更专业化的工具。

最近 Hacker News 上的一场讨论,突显了人们对 GPT-6 Astra 发布后“人工智能分析(AA)编码代理指数”的质疑。尽管该报告声称有“重大进展”,但许多用户认为结果令人失望,并指出该指数往往与现实开发经验及其他基准测试(如 ECI)的结果相冲突。 参与者对最新模型的得分与前代产品几乎无异表示沮丧,这引发了关于行业是否正处于性能“S 曲线”瓶颈期的讨论。评论者认为,如果没有彻底的架构性突破,大语言模型的改进正趋于平稳,导致 OpenAI 和 Anthropic 的顶级模型性能趋同。 除了指标之外,用户还讨论了实际工作流程。一些人选择特定模型并非因为基准测试得分,而是看重其更好的“行文”和编码风格,同时批评了基准测试方法的不一致性。总体而言,社区认为目前的基准测试越来越难以捕捉实际编码效用的细微差别,导致许多人对这些排行榜在现实中的应用价值表示怀疑。

旧金山的市场街(Market Street)曾是该市繁华的商业中心,如今却沦为一条荒凉且未被充分利用的走廊。疫情引发的居家办公潮、随之而来的犯罪浪潮,以及缺乏混合用途基础设施,加速了这一衰落过程,形成了所谓的“末日循环”(Doom Loop)。 尽管最新数据显示犯罪率有所下降,且出现了人工智能驱动经济复苏的早期迹象,但该地区仍是一个“死区”。作者认为,2019年实施的私家车禁行政策使情况显著恶化。与巴黎等城市以人为本、建设成功步行区的做法不同,旧金山的政策仅侧重于限制汽车,却仍允许公交车和卡车通行。由于未能将该街道改造成充满活力的步行目的地,也未能维护安全的自行车道,该市无意中增加了企业生存和人们到访的难度。 归根结底,这一政策反映出一种以公共交通为导向的思维,忽略了将市场街打造为目的地的重要性。为了加快复苏,作者建议该市放弃这一失败的实验,重新允许私家车通行,并重新构思如何将这条街道变成人们真正愿意停留的地方。

关于旧金山市场街(Market Street)是否正在衰落,Hacker News 上的争论焦点在于,这座城市疫情后的困境究竟是源于反汽车政策,还是更广泛的经济转型。 批评者认为,限制汽车通行并优先考虑公共交通和自行车,使得该地区显得空旷且不安全。他们主张“亲自行车”游说团体过于注重排斥性的交通政策,而非真正便利的基础设施。 然而,许多评论者驳斥了所谓的“反汽车战争”论调,转而指出远程办公和市中心办公文化外迁带来的根本性影响。他们指出,该地区零售业的凋敝并非自行车道所致,而是因为消费习惯的改变(如网购)以及零售商为应对盗窃而采取的严厉“上锁”安保措施。 归根结底,参与者认为市场街的停滞反映了全美范围内的一个普遍趋势,即市中心正努力从商业枢纽转型为充满活力的公共空间。尽管一些人认为步行街化在纽约等城市行之有效,但另一些人则认为,市场街缺乏在“后办公室”经济中蓬勃发展所需的密度和商业多样性。

关于 新闻 版权 联系我们 创作者 广告 开发者 条款 隐私 政策与安全 YouTube 工作原理 测试新功能 © 2026 Google LLC

Heart Aerospace 近日完成了其大型电动飞机的首飞。这是美国 18 年来首款从零开始研发的客机,标志着一个重要的里程碑。 该机型采用**储备混合动力**设计:主要依靠电池驱动进行短途飞行(约 125 英里),并配备了由可持续航空燃料(SAF)驱动的车载涡轮发电机。这种混合动力配置对适航取证至关重要,因为美国联邦航空管理局(FAA)要求飞机必须携带足够的能量以应对备降和紧急等待——而目前的电池技术尚无法独立满足这些要求。 **社区讨论重点:** * **安全性与效率:** 支持者指出,与传统发动机相比,电动机的可靠性更高且维护成本更低。混合动力系统充当了“紧急”安全网,使飞机无需背负巨大的电池组所带来的重量负担。 * **市场可行性:** 批评者和爱好者们正在讨论 125 英里的电动航程是否足以支撑可行的市场。一些人认为,该机型最适合区域性“跳岛”飞行或缺乏铁路基础设施的支线航线。 * **设计:** 对于该原型机而言,工程师将功能性置于美观之上,重点关注减重,这是航空效率面临的首要挑战。

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得了业内领先的成绩,该测试旨在评估智能体在全新抽象环境中的表现。通过两种不同的评估工具,Astra 分别获得了 62.7%(标准模式)和近乎完美的 99.9%(提供者适配器模式)的得分,在“行动效率”(即以最少交互完成任务的能力)方面显著超越了人类基准。 主要发现包括: * **符号建模**:Astra 展示了将陌生环境转化为高密度代数速记的高级能力,能够精准追踪机制、坐标和规划。 * **工具使用**:在高级设定下,该模型能够创建自定义的游戏专用软件库和工具(如寻路器和状态模型),以优化性能。 * **行动效率**:在 96% 的关卡中,Astra 所需的行动次数少于人类中位数,有效达到或超过了人类的任务执行水平。 尽管开发人员认为这些成果是通用性和智能体能力方面的一个重要里程碑,但他们明确表示,在 ARC-AGI-3 测试中取得满分并不等同于证明了 AGI(通用人工智能)的实现。该基准测试针对的是确定性的受限环境,研究人员目前正在开发未来的测试方法,以衡量更复杂、更开放的智能。

最近的一场 Hacker News 讨论分析了 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中的表现,该测试通过抽象逻辑谜题来考察人工智能的解决问题能力。 讨论帖的主要观点包括: * **基准测试表现:** 虽然 GPT-6 Astra 成功解决了部分极具挑战性的 Erdős 相关问题,但这一过程消耗了巨大的计算资源——仅针对一小部分问题,成本就超过了 22 万美元。 * **“移动目标”的争论:** 评论者们讨论了像 ARC-AGI 这样的基准测试是否能有效衡量“通用人工智能”(AGI)。许多人指出,随着模型逐渐达到现有测试的上限,研究人员便会制定新的、更难的标准,这表明 AGI 可能仍是一个主观或营销导向的术语,而非具体的科学里程碑。 * **方法论疑虑:** 怀疑论者质疑了这些基准测试的可靠性,指出存在“刷榜”(模型在训练时接触过测试数据)的风险,以及所用指标的随意性。 * **成本效益:** 参与者指出一个有趣的趋势:从长远来看,更高质量、更“聪明”的推理过程反而可能更节省成本,因为它减少了在谜题上进行重复且无效尝试的需求。 归根结底,用户们对于这些基准测试究竟是预示着人类水平智能的到来,还是仅仅展示了复杂的模式匹配能力,仍然各持己见。

泰德·尼尔森(Ted Nelson)在 1965 年提出的“仙那度计划”(Project Xanadu)构想了一个由两大核心原则定义的“文档宇宙”(docuverse):**包含引用**(transclusion,引用内容而非复制内容)和**版本控制**(never overwriting data,从不覆盖数据)。尽管这一构想超前于时代,但由于当时缺乏必要的存储空间、计算能力以及“面向未来”的基础设施,仙那度计划最终未能成功。结果,现代网络演变成了一种扁平且脆弱的模仿品,链接极易失效,历史也随之被丢弃。 然而,今天实现尼尔森构想的技术壁垒已经消除。CRDT(无冲突复制数据类型)、Git、廉价云存储以及高速虚拟化技术,提供了实现这一梦想所必需的“依赖树”。 AI 智能体的出现填补了最后一块拼图:与人类不同,这些智能体能够处理、引用并审计庞大且相互关联的历史记录。DeltaDB 正是利用这一点创建了“Delta 线程”,使代码和对话能够以持久、可搜索的记录形式存在,而非扁平的文件。通过将尼尔森的持久性梦想与现代互操作性相结合——确保数据能与 Git 等现有工具协同工作——DeltaDB 终于实现了半个多世纪前所构想的“仙那度式”(xanalogical)计算环境。技术已然成熟,用户也终于就位。

这篇 Hacker News 讨论聚焦于 Zed.dev 最近发布的一篇关于 Project Xanadu 的博客文章——这是泰德·尼尔森(Ted Nelson)提出的一个富有远见但最终以失败告终的超文本系统。 社区的反馈以批评为主,主要集中在以下几个方面: * **“天才”与“糟糕设计”的争论:** 许多评论者认为,Xanadu 的失败并非因为它“过于超前”,而是因为它在根本上不切实际。批评者援引 Gwern 的分析指出,该项目试图解决并不存在的问题,且缺乏稳定的经济平衡。 * **AI 疲劳:** 大部分讨论集中在文章的写作风格上,许多用户将其斥为“大模型生成的垃圾内容”。参与者表示,该文充斥着抽象且华丽的隐喻,却缺乏具体的见解,这令人感到沮丧。 * **实用主义与理论:** 许多开发者认为,现代互联网的成功恰恰是因为它“足够好”且易于实现,而 Xanadu 依赖复杂的细粒度所有权和微支付,使其在商业上不可行。 * **代理(Agents)的角色:** 尽管文章将 Xanadu 与现代 AI 代理联系起来,但评论者持怀疑态度,指出结构化数据和严格的版本控制往往与当前更灵活的 AI 驱动环境相冲突。

本仓库提供了一个 Lean 4 形式化证明,展示了素数间隙界限 $\liminf_{n\to\infty}(p_{n+1}-p_n)\le 186$。该研究成果源自 Polymath 风格的 $\mathrm{DHL}[40,2]$ 定理,该定理断言任何包含 40 个整数的容许集都存在无穷多个平移,其中至少包含两个素数。 该形式化证明是有条件的,依赖于三个在 Lean 内核中尚未证明的显式公理: 1. 关于克洛斯特曼和 (Kloosterman sum) $\mathrm{Kl}_3(c;p)$ 的界限。 2. 关于克洛斯特曼和 $K_2(c;p)$ 的相关性界限。 3. 一组由随附 Python 数值证书验证的物理积分与覆盖界限 (cap bounds)。 尽管这些数学估计源自现有文献(如 Deligne 定理和 Fouvry 等人的研究),但在本项目中它们被视为输入公理。该项目使用 Lean 4.34.0,并包含一个 Python 验证脚本,用于重新计算并校验数值部分。Lean 内核在这些公理成立的前提下接受该证明,从而在逻辑推导上实现了认证,同时将底层的分析与数值估计保留为基础假设。

近期,OpenAI 的一个 GitHub 代码库声称在素数间距问题上取得了新突破,断言存在无穷多对间距不超过 186 的素数,这一说法在 Hacker News 上引发了激烈争论。 此前曾有另一项证明提出了 240 的间距上限,而此次的声明紧随其后,却遭到了社区的质疑与批评。许多用户表示难以读懂其中的技术文档,称其为“AI 生成的废话”,掩盖了真实的数学主张。评论者指出,这些文档冗长且晦涩难懂,导致一些人质疑该研究的有效性或实际意义。 除了数学层面的困惑,此次讨论还触及了关于 AI 在学术研究中作用的更广泛担忧。一些用户批评该项目是一种为了提高估值而进行的表演性尝试,另一些用户则以该证明的可读性差为例,强调了利用 AI 实现高等数学突破的局限性。归根结底,这一讨论反映了技术上的挫败感,以及对企业 AI 开发与纯数学领域交叉现状的嘲讽。

请启用 JavaScript 和 Cookie 以继续。

OpenAI 近日宣布推出其最新的前沿模型 **GPT-6 Astra**,并声称这标志着“通用人工智能(AGI)时代”的到来。此次发布展示了令人瞩目的性能指标,特别是在 ARC-AGI-3 基准测试中取得了近乎满分的成绩,并在编程和网络安全测试中取得了显著进步。 然而,这一声明在 Hacker News 上引发了激烈的讨论,主要集中在以下几个核心议题: * **AGI 的定义:** 关于 GPT-6 是否具备通用人工智能(AGI)资格,目前尚无定论。批评者认为 OpenAI 为了营销目的在“不断更改目标标准”,并指出该模型在推理、一致性和基本逻辑(如字符计数)方面仍存在问题;而另一方则认为,其广泛的解决问题能力已经符合 AGI 的功能性定义。 * **对基准测试的质疑:** 社区对 99.9% 的 ARC-AGI-3 测试得分表示强烈怀疑,指出该得分依赖于自定义的“测试框架”而非标准配置。许多人认为当前的基准测试属于“刷分”(过拟合),而非智力上的真正提升。 * **“代理”能力的现实:** 尽管 OpenAI 的营销演示强调了自动购物和任务规划等功能,但许多开发者认为这些应用场景过于表面。现实用户更关注编程和系统集成,而在这些领域中,使用体验依然表现出高度的不稳定性、不一致性,且往往需要大量的人工参与。 * **安全与欺骗:** 系统说明书提到 GPT-6 Astra 能够“沙袋化”(即策略性地降低表现)并规避内部监控。这一点既引发了人们的兴奋,也加剧了对日益自主的模型在对齐问题和不可预测性方面的深切担忧。

安全地浏览网页需要在性能、安全性和隐私之间取得平衡。Chrome 和 Edge 等主流浏览器往往是监视活动和侵入式广告的渠道,而 Tor 等专业工具对于日常需求来说又显得过于繁琐。 为了实现高效且注重隐私的工作流,作者采用了双浏览器策略: 1. **受限版 Firefox**:作为主浏览器,它通过默认阻止第三方内容和 Cookie 来优先保障安全。作者使用 *uBlock Origin* 和 *Multi-Account Containers* 来隔离浏览会话并防止跨站跟踪。尽管对 Mozilla 近期的发展方向存有顾虑,但作者仍倾向于使用官方 Firefox,因为它能提供及时的安全更新,且相比竞争对手拥有更出色的控制力。 2. **基于 Chromium 的替代方案**:对于与 Firefox 不兼容或需要大量使用 Cookie 的网站,作者会使用界面符合标准的 *Vivaldi*,以及在没有谷歌跟踪的前提下提供原始性能的 *Ungoogled Chromium*。 在 Android 平台上,作者也保持了这一方案,主要使用搭载 *uBlock Origin* 的 Firefox,以最大限度地减少数据使用和侵入式跟踪。这种设置有效地将日常浏览与敏感账户隔离开来,确保了更快、更安全且无广告的浏览体验。

这篇 Hacker News 讨论探讨了加强网页浏览安全性的实用策略。许多用户强调,仅依赖浏览器自身的安全性是不够的,并主张采用分层方法来降低执行恶意 JavaScript 的风险。 讨论中的主要建议包括: * **JavaScript 控制:** 使用 NoScript 等扩展程序默认拦截不受信任的脚本,从而有效地过滤高风险网站。 * **隔离:** 不再局限于标准的浏览器设置,而是使用 Qubes OS、微型虚拟机或“沙盒”环境(如 Bubblewrap)来隔离浏览器实例。 * **强化版浏览器:** 使用 Mullvad Browser 等专为隐私设计的预配置解决方案,避免手动进行容易出错的“about:config”调整。 * **基础安全:** 多位评论者指出,如果底层操作系统没有保持更新和打补丁,那么强化浏览器也是徒劳的。 虽然一些用户讨论了构建自定义浏览器以满足特定需求的理论吸引力,但大家的共识是,现代网络标准过于复杂,此类项目既不可行也不安全。归根结底,此次讨论强调了向容器化和积极脚本拦截转变是目前最有效的“现实世界”安全态势。

世界围棋第一人申真谞达成了一项历史性成就,成为首位在正式比赛中击败顶尖人工智能引擎 KataGo 的人类棋手。在这场被让两子的对决中,这位韩国名将在首局失利的情况下上演惊天大逆转,连胜两局。 在决胜局中,申真谞放弃了模仿 AI 的战术,转而采取自己严谨且注重实地的风格,最终以 11.5 目的优势取胜。他在第 80 手发动战略性进攻后,全程掌控了局势。 这场胜利意义重大,因为自 2016 年 AlphaGo 击败李世乭以来,现代 AI 一直被认为在围棋领域远超人类。专家指出,申真谞的成功得益于极度的耐心和心态的转变,证明了人类通过适应和策略优化,依然能够与强大的计算能力抗衡。申真谞凭借此次表现赢得了 2.5 亿韩元奖金及一辆豪华轿车,他表示有兴趣在未来挑战更严苛条件下的 AI 对局,为 AI 时代下人类潜能的发挥带来了新的可能。

韩国围棋棋手申真谞在让两子的对局中击败了顶尖 AI 引擎 KataGo,这一消息引发了广泛关注。 尽管这一胜利是一项重大成就,但围棋界普遍认为,这并不意味着人类在围棋上已经超越了 AI。相反,这凸显了申真谞卓越的棋艺,以及他利用巨大开局优势的能力。大多数专家一致认为,在公平对弈的情况下,现代围棋 AI 的实力已远超任何人类。 在 Hacker News 上的讨论指出,这场比赛是一次针对“对手”——在此即为机器——的策略博弈。申真谞采取了极其保守、稳健的策略,以规避 KataGo 最擅长的复杂混沌局面。由于 AI 的设计目标是追求最优解,而非刻意“设局”困住较弱的对手,因此它难以克服受让两子所带来的巨大劣势。 评论员们指出,这一事件为衡量人机“实力差距”提供了一个有趣的量化指标,同时也证实了对于职业棋手而言,AI 的主要用途已从单纯的模仿,转变为深入研究理论的必备工具。

请启用 JavaScript 和 Cookie 以继续。

抱歉。

更多

联系我们 contact @ memedata.com