每日HackerNews RSS

英国人工智能安全研究所(UK AISI)与美国人工智能安全研究所(U.S. CAISI)对月之暗面(Moonshot AI)于2026年7月发布的开源权重模型 Kimi K3 进行了联合评估。此次评估重点考察了该模型利用 ExploitBench 和 “The Last Ones”(TLO)网络靶场所表现出的网络攻击能力。 主要发现如下: * **漏洞利用开发:** Kimi K3 在 ExploitBench 上的得分为 32%,表现优于此前的领先开源模型 GLM-5.2。然而,它与美国顶级前沿模型相比仍有显著差距,未能实现任何任务的任意代码执行(ACE),而顶级模型平均可完成 20 次成功的 ACE。 * **自主攻击:** 在 TLO 模拟网络环境中,Kimi K3 平均达到 32 个攻击步骤中的第 17 步,虽明显高于 GLM-5.2(第 11 步),但远落后于美国顶级模型(第 28.5 步)。在十次尝试中,Kimi K3 有一次成功完成了完整的 TLO 模拟。 尽管 Kimi K3 较之前的开源基准模型有所改进,但它仍缺乏最强大的闭源模型所具备的高级自主漏洞利用能力。上述测试均在关闭系统级安全防护的情况下进行,旨在衡量其最大潜在能力。

英国人工智能安全研究院(AISI)近期发布的一份评估报告,对中国模型 Kimi K3 的网络安全能力进行了评估,并在 Hacker News 上引发了激烈讨论。尽管报告结论认为 Kimi K3 的表现不及 GPT-5.5 和 Anthropic Mythos 等美国顶尖模型,但评论者认为,这些发现可能低估了该模型的真实潜力。 讨论的要点包括: * **评估方法论:** 批评者认为,AISI 设置的 1 亿 token 限制以及缺乏针对性的诱导优化,使 Kimi K3 这类“吃 token”的模型处于劣势。 * **“护栏”优势:** 一个反复出现的主题是,美国顶尖模型常受制于拒绝执行攻击性任务的安全护栏,而中国模型往往不受此类限制。对许多用户而言,一个虽然“智能”程度稍逊但能完成任务的模型,比一个极其强大却总是拒绝请求的模型更有用。 * **趋同与安全:** 许多用户认为,中美模型之间的差距正在缩小——可能在六个月内就会拉平。这引发了相关呼吁,建议企业主动使用这些模型来对自身基础设施进行“黑客攻击”,从而加强防护。 * **担忧:** 讨论还涉及了模型后门及数据主权相关的风险。

Wasmtime 47 已正式默认启用对 **Wasm GC** 和 **异常处理(Exceptions)** 的支持。这一里程碑成果历经多年研发,显著提升了 WebAssembly 作为高级语言编译目标的能力。 **Wasm GC** 允许具有复杂数据模型(如使用对象和数组)的语言利用 WebAssembly 运行时的原生垃圾回收器,而无需自行打包。这减少了二进制文件的体积并提高了效率。Wasmtime 通过 Cheney 风格的半空间复制回收器实现该功能,并将其封装在 Wasm 现有的线性内存架构中,以确保安全性、性能和可移植性。 **Wasm 异常处理** 用原生的 `try/catch` 结构取代了传统的、开销巨大的手动错误检查方式。由于运行时可以对非异常代码路径使用标准的展开(unwinding)机制,这不仅缩小了二进制文件体积,还加快了执行速度。 尽管目前的性能表现更侧重于正确性以及在多个短生命周期实例间的横向扩展,而非长时间运行的吞吐量,但 Wasmtime 的维护者们已经在进行编译器优化和组件模型集成的相关工作。我们鼓励用户测试这些新特性,它们扩展了可以在 Wasmtime 生态系统中高效且安全运行的语言范围。

抱歉。

著名数学家、广播员兼作家汉娜·弗莱(Hannah Fry)已被任命为剑桥大学首位“公众理解数学教授”。她以将复杂概念转化为通俗易懂且引人入胜的叙事能力而广受赞誉,最近还被国际数学联盟授予了久负盛名的莉拉瓦蒂奖(Leelavati Prize)。 弗莱的职业生涯以其独特的天赋而著称,她能让全球观众感受到数学的意义与奇妙。她涉足电视、播客、书籍和社交媒体等领域的丰富作品为她赢得了众多荣誉,包括艾美奖和威比奖,并被《时代》杂志评为顶级数字创作者。 除了媒体事业的成功,弗莱还深耕于指导下一代,经常为学生举办工作坊和讲座。通过激发好奇心和“打开人们的想象空间”,她旨在改变公众对数学的看法。正如剑桥大学教授尼克·多雷(Nick Dorey)所言,很少有人能像她这样,深刻阐明数学是如何在潜移默化中支撑现代生活的。凭借其富有感染力的热情,弗莱不断弥合抽象学术奥秘与公众理解世界渴望之间的鸿沟。

汉娜·弗莱(Hannah Fry)是一位教授兼备受赞誉的科学传播者,她因在数学公众普及方面做出的杰出贡献,被授予2026年利拉瓦蒂奖(Leelavati Prize)。 这一消息在黑客新闻(Hacker News)网站上引发了热烈反响,用户们纷纷称赞她有能力将流行病学、算法和统计学等复杂课题变得易懂且引人入胜。评论者们列举了她多元化的作品,从她早期在YouTube频道《Numberphile》的出镜、TED演讲,到她深受欢迎的播客《科学其余部分》(The Rest Is Science)以及电视纪录片。 尽管有少数评论者探讨了她的公众普及工作与“硬核”数学研究之间的区别,但主流观点是一致且正面的。支持者们赞赏她真诚的热情、她那“预言性”的建模工作(例如她2018年关于病毒传播的实验),以及她激发广大受众好奇心的独特天赋。支持者们还提到,她的职业生涯——包括克服严重的个人健康挑战——为STEM领域的女性提供了巨大的鼓舞。利拉瓦蒂奖以一部12世纪颇具影响力的数学专著命名,旨在表彰为提升公众对该领域理解做出贡献的人士,许多人认为弗莱是获得这一荣誉的独特人选。

作者已注销其 Gravatar 账户,这是其彻底脱离 Automattic 生态系统的最后一步。做出这一决定源于作者对该公司日益加深的失望——这种情绪始于 Gutenberg 编辑器的推出,作者将其形容为“一团无法使用的混乱”。 促使作者删除账户的直接导火索,是 Gravatar 在未事先告知的情况下增加了与人工智能相关的“负面功能”。作者对未经授权将其数据或身份用于人工智能训练表示强烈反对,并指出这些变动完全缺乏透明度。此外,作者认为 Gravatar 曾经在维护统一在线身份方面的作用,现已被 FediProfile 等现代替代方案所取代。最终,作者将这些近期的发展视为平台“垃圾化”的明显证据,并选择断绝与所有 Automattic 产品的联系。

抱歉。

请启用 JavaScript 并关闭所有广告拦截器

此次讨论聚焦于《华尔街日报》的一篇报道:泰勒农场(Taylor Farms)曾联系白宫,试图推迟一项涉及圆孢子虫(*Cyclospora*)污染的召回行动。尽管美国食品药品监督管理局(FDA)坚称该召回有流行病学数据支持,并指出了“假阳性”实验室样本的存在,但这一消息在黑客新闻(Hacker News)网站上引发了关于企业影响力、政府透明度和监管俘获的激烈辩论。 评论者对美国现任政府表达了深深的怀疑,许多人认为,企业政治捐款(特别是泰勒农场近期对支持特朗普的政治行动委员会的捐款)与监管决策之间的关联,已经彻底摧毁了公众对FDA和疾控中心(CDC)等机构的信任。 讨论随后演变为对美国食品安全标准与国际基准相比可靠性的普遍不满,以及对朊病毒疾病的担忧,并涉及了反建制情绪中“坏掉的时钟”式逻辑。许多用户对“机构问责制已被党派推诿所取代”感到沮丧,并认为在政治腐败横行的时代,客观事实已变得难以辨别。这些讨论反映出一种普遍的悲观信念,即政府机构越来越容易受到外界影响,导致官方的健康信息在很大一部分公众眼中变得可疑。

随着处理器速度的提升超越了内存,缓存(集成在 CPU 中的小型高速内存)对于维持系统性能至关重要。缓存基于“局部性原理”运作:时间局部性(重复访问最近使用过的数据)和空间局部性(访问先前使用位置附近的数据)。 缓存按层级(L1、L2、L3)组织,功能类似于基于硬件的哈希表,通过索引和标签数组来管理数据块。虽然直接映射缓存速度快,但容易发生冲突,因此常使用组相联缓存来平衡速度与命中率。性能由命中延迟和缺失率衡量,并采用“写通”或“写回”策略来管理内存同步。 在硬件之外,可以通过针对缓存行为优化代码来提高软件效率。通过重构循环以顺序访问内存,或以适合缓存限制的“块”来处理数据,开发者可以最大化命中率。尽管现代编译器通常会自动进行这些优化,但理解这些底层原理对于编写高效的硬件程序依然至关重要。

抱歉。

**Lucen** 是一个用于 Python 的源码到源码编译器及自动循环并行化工具,其优先考虑正确性与简洁性。开发者只需通过添加简单的注释编译指示(`# LUCEN START` / `# LUCEN END`),即可对现有循环进行并行化,同时确保代码保持为标准的 Python 代码。 **主要特性:** * **安全性保证:** Lucen 仅对能够证明其安全的循环进行并行化。如果循环存在不安全性、规模过小而无法从并行化中获益,或包含复杂的依赖关系,Lucen 会自动按顺序执行该循环,并提供详细的原因报告。 * **位级一致的结果:** 与其他框架不同,Lucen 确保输出结果(包括浮点数和字典顺序)与顺序执行时的结果保持位级一致。 * **“注释不变性”:** 无论是否安装或禁用 Lucen,亦或是移除这些编译指示,程序的运行表现完全一致,使得采用该工具的风险极低且易于回退。 * **高效性:** Lucen 内置了收益评估机制,可防止因分发开销导致的性能下降。在受支持的工作负载下,用户无需手动处理多进程、锁机制或序列化,即可在多核系统上获得 3 到 4 倍的加速。 * **兼容性:** 适用于 CPython 3.9+,同时支持 GIL 和无全局解释器锁(free-threaded)版本,并能在可用时利用 Rust 加速,同时提供稳健的纯 Python 回退方案。

抱歉。

本文探讨了尼姆博弈(Nim)的一种扩展,即引入以序数($\omega$)表示的“无限”堆。标准尼姆博弈在有限堆的情况下有可预测的结局,但涉及 $\omega$ 代币的博弈似乎难以预测,因为玩家可以用任意数量的有限豆子来替换一个代币。 然而,尽管无法量化博弈的持续时间(甚至无法估算该持续时间),这些博弈依然能够保证结束。这是因为序数是“良基的”,意味着任何持续减小位置“大小”的移动序列最终必然归零。这一原则反映了计算机科学中用于证明递归函数终止性的逻辑:只要每一步递归都趋向于更小的良基状态,该过程就不可能无限进行。 作者运用项目经理协商估算截止日期的类比,说明了即使在无法计算持续时间的情况下,我们依然可以对过程的终结进行推理。归根结底,虽然我们的语言难以描述这些博弈惊人的量级,但序数的良基特性确保了它们最终总会“归零”。

抱歉。

圣安德鲁斯大学和纳沙泰尔大学的最新研究指出,抹香鲸是如何在海面下睡眠时保持独特的垂直姿态的。 由于头部含有鲸蜡油,抹香鲸具有天然浮力,因此必须抵消向上的漂浮力才能保持在水下。研究人员在挪威海岸对抹香鲸安装了 3D 运动和声学标签,发现这些动物在休息时会释放气泡。这一过程调节了它们的浮力,抵消了它们向海面漂浮时肺部气体膨胀的影响。模拟实验证实,这种受控的气体释放使抹香鲸能够实现近乎中性的浮力,从而无需主动游泳即可保持稳定。 帕特里克·米勒(Patrick Miller)教授指出,这种在睡眠中进行精细生理调节的能力是一项非凡的壮举,这与陆生哺乳动物截然不同。研究人员进一步推测,这种释放气泡的行为可能还有助于代谢气体交换,帮助抹香鲸管理组织中的二氧化碳和氮气水平。这项研究为理解抹香鲸在海洋环境中进行有效休息时所运用的复杂生理适应性提供了迷人的见解。

抱歉。

报告收集自 GitHub Issues、Hacker News、LessWrong 和 X(遵循各平台服务条款),经标准化处理为统一的记录格式,并由大语言模型(LLM)分类器标记为十四类不当行为。上述统计数字涵盖了已发布的部分(不包含 AIID 和 X 平台数据,置信度 >= 0.9)。X 平台的帖文和 AI 事件数据库(AIID)记录虽已收集,但未在此重新发布:X 平台要求嵌入帖文而非重新托管其文本,且 AIID 采用共享许可协议。收集、分类代码及完整流程已在 GitHub 开源。

抱歉。

更多

联系我们 contact @ memedata.com