每日HackerNews RSS

Figure 在保护其专有硬件、同时避免延误 F.04 项目的情况下,退役了 F.02 机器人车队。由于美国和墨西哥的铸造厂拒收采用锂离子电池的机器人,Figure 与阿诺德·施瓦辛格合作,并在芬兰伊马特拉找到了一家愿意接收这些机器人的铸造厂。 团队在模拟环境中训练 F.02 机器人,并以特技演员作为参照,让它们自主跳入盛有 molten steel 的桶中。尽管现场高温严重、存在电磁干扰、电子设备不断故障,熔炼时间也只有六次、每次仅 20 分钟,且机器人只能停留 24 小时,但它们仍成功完成了任务。 回收的钢材被运回美国,并被加工成限量发行的纪念品,为收藏者保留了 F.02 的一部分历史。如今,大多数 F.02 机器人已被销毁,只有少数几台仍留在 Figure 总部。

Figure AI 的“F.02 拆解”视频展示了人形机器人在熔融金属铸造厂中被摧毁的过程,画面包括爆炸、精致的制作,以及让人联想到《终结者》的阿诺德·施瓦辛格客串出场。 《黑客新闻》上的讨论呈现明显分化:许多观众认为视频很有趣、很酷,也是一次有效的营销——Figure 通过销毁卖不出去的库存,成功吸引了关注和投资者兴趣。另一些人则批评,这是一场鲁莽且以《终结者》为主题的公关噱头,掩盖了 Figure 有限的技术进展,也浪费了资源。 怀疑者质疑销毁过程是真实的还是经过策划,以及锂电池和液压油本是否应该引发规模更大的爆炸。据报道,Figure 曾很难找到愿意承担风险的铸造厂,之后又发布了幕后花絮。一些规模较小的讨论则延伸到先进机器人是否可能产生意识、自主性,甚至宗教,并开玩笑讨论未来的“机器人霸主”。 总体而言,即使在那些并不看好 Figure 的人看来,这场视频也被广泛视为一项令人难忘的视觉奇观。

本文分步介绍了一个教材定理的 Lean 4 形式化证明:三行二进制位构成的语言中,若最下面一行等于上面两行之和,则该语言是正则语言。由于 DFA 从左向右读取符号,而二进制加法从最低有效位开始处理更为方便,因此证明构造了一个识别反转语言的 DFA。 该 DFA 有三个状态,分别跟踪进位为 0、进位为 1,以及一个死状态。进位为 0 的状态既是初始状态,也是接受状态,从而防止溢出。 核心证明建立了一个运行不变式,将自动机的执行与任意长度输入上的二进制加法联系起来。归纳过程使用若干辅助引理来拆分运行、将一次转移转化为加法器方程,并在最低有效位处分解整个算术方程。布尔情况通过 `decide` 或 `simp` 处理,线性算术则由 `omega` 求解。 最后,利用 Mathlib 中关于语言反转的封闭性定理,将正则性传递回原语言。本文还指出,形式化验证能够揭示规范中原本未明确写出的要求,同时警告不应盲目信任机器生成的证明,而应确保这些证明仍然易于理解。

一场关于《面向软件工程师的 Lean 证明剖析》的 Hacker News 讨论,焦点在于非常大的、由机器检查的 Lean 证明是否真正值得信任。一位评论者认为,即使代码经过了形式化验证,语义错误仍可能藏在其中,因此这类成果尽管 Lean 的运行时十分稳健,却依然异常脆弱。另一位评论者则指出,文章缺少目录。 不少人建议,在开始学习 Lean 之前,先掌握证明论、直觉主义逻辑、柯里–霍华德对应、不完备性和紧致性。 其他人则好奇,如果不验证所有内容,Lean 是否仍然有用——例如,把它当作描述模块行为及其性质的一种精确规格语言,再辅以基于属性的测试。有人回答称,可以,并将这种方法与 Hoare 逻辑和 Concrete Semantics 框架进行了比较,不过 Lean 的程序验证库还不如其数学生态系统成熟。 最后的讨论较为怀疑:一位读者认为 Lean 难以理解,另一位则认为它不过是一项学术上的新鲜事物,第三位则回应说,面对陌生技术,在批评之前应当先努力理解它。

请启用 JavaScript 和 Cookie 以继续访问。

Hacker News 上的一篇讨论帖介绍了一篇 Big Think 文章。该文章声称,威尼斯在 12 世纪与君士坦丁堡的战争促成了世界上第一个公共债券市场。评论者将威尼斯大规模借款与其资助第四次十字军东征联系起来,认为拜占庭方面中途改变资金用途,将借款用于追讨债务和复仇,最终导致威尼斯在 1204 年攻陷并洗劫君士坦丁堡。讨论还涉及这给拜占庭与威尼斯关系造成的破坏,以及威尼斯后来与奥斯曼帝国的冲突。 几位评论者质疑文章使用“第一个债券市场”这一说法。他们认为,威尼斯在 1172 年推出的 prestiti 只是公共债券市场的先驱,而非成熟的市场;其长期公共债务直到 1262 年才得到整合,而比萨和热那亚更早也有类似的债务安排。其他一些说法,包括中世纪人口数字以及威尼斯政治转型的性质,也被认为过于简化。 随后,讨论范围扩展到政府借款、中央银行独立性、量化宽松、货币创造、通胀与通缩,以及债券市场究竟主要是为政府融资,还是用于配置资本和分散风险。帖中还辩论了多种历史和经济类比,而不同参与者往往基于明显不同的政治立场得出结论。

伊丽莎白·考玛讲述了家里传承下来的手工钩针编织品。这些作品曾差点被丢弃,如今却被保存下来,也让人得以看见纤维艺术背后鲜为人知的劳动。她追溯了编织的发展历程:从中世纪由男性主导的行会和维持生计的劳动,逐渐发展至针织业以及框架编织机的发明。随着机械化取代许多手工编织者,编织逐渐转变为一种休闲活动,并与维多利亚时期的上层阶级女性联系起来。 后来出现的钩针编织,最初曾在客厅社交中与编织针编织相竞争,后来尤其擅长制作蕾丝。尽管钩针编织多年 resists 机械化,但现代蕾丝机和编织机已经能够仿制钩针编织的效果。考玛解释了如何辨别真正的手工钩针作品:观察针法结构和衣物内部;机器制作或刺绣而成的仿品,内部往往会露出网状结构或不同的针法。 本期节目将这些工艺史与自动化、时尚、性别、阶级和道德消费等更广泛的问题联系起来,并推荐那些与手工钩针编织者合作的品牌。

Hacker News 最新 | 往期 | 评论 | 提问 | 展示 | 工作机会 | 提交 登录 蕾丝与劳动:从真正的卢德派身上汲取的经验 (articlesofinterest.substack.com) 12 分 由 surprisetalk 提交 8 小时前 隐藏 | 往期 | 收藏 1 条评论 帮助 vonStackelberg 7 小时前 [–] 太好了,终于看到这里有人提到这件事了。她的播客都很棒,不过这一期我还没听。关于拉链的那一期非常 entertaining。她还制作过一个系列,讨论军事与户外服装行业之间的相互依存。非常精彩! 回复 考虑申请 YC 2027 年冬季批次! 申请截止时间为 11 月 2 日。 指南 | 常见问题 | 列表 | API | 安全 | 法律条款 | 申请加入 YC | 联系方式 搜索:

关于 媒体 版权 联系我们 创作者 广告合作 开发者 条款 隐私 政策与安全 YouTube 的运作方式 测试新功能 © 2026 Google LLC

讨论探讨了 CPU 能否取代 GPU,用于人工智能和大规模矩阵计算。GPU 仍具有优势:拥有数千个可并行工作的 CUDA 和 Tensor 核心、深度流水线,以及高度优化的 CUDA 软件。相比之下,CPU 的灵活性更高、系统内存更大,并且在稀疏或专用工作负载上可能具有更好的效率。 评论者认为,CPU 可以通过更强的矩阵/SIMD 指令、每个核心配备专用内存,以及更好的互连技术来提高竞争力。历史上的相关例子包括 MMX、AVX、英特尔集成显卡和 Larrabee 项目。Tenstorrent 采用 RISC-V 核心阵列并为每个核心配备本地 SRAM 等替代方案,也可能模糊 CPU 与 GPU 之间的界限。 主要障碍在于吞吐量、内存带宽,以及训练前沿模型的成本。量化、LoRA、梯度检查点和重计算等技术可以降低 CPU 的内存需求,但目前尚无结论表明,仅使用 CPU 实际能够训练多大规模模型。

这篇文章追溯了“唯一凭直觉就能使用的界面就是乳头”这一说法的来源。人们通常认为这句话出自布鲁斯·埃迪格,但他否认是自己发明的。早在1994年8月,斯科特·弗朗西斯就在一篇帖子中提出了这一概念。1995年1月,杰·沃尔默也给出了几乎相同的表述:“实际上,唯一真正凭直觉就能使用的界面就是乳头。”从1995年2月起,埃迪格开始使用类似说法,其中包括:“除此之外,一切都得靠学习。”他究竟是沿用了沃尔默的措辞,还是从其他地方看到了这个想法,目前并不清楚。作者认为,埃迪格最有资格被视为人们熟悉的那种说法的来源,但作者更喜欢他后来更为讽刺的版本:“根本不存在凭直觉就能使用的界面,连乳头也不例外。一切都得靠学习。”

Hacker News 上的一则讨论质疑了“唯一符合直觉的界面就是乳头”这一说法。许多父母和哺乳专业人员指出,母乳喂养并不总是符合直觉:婴儿可能难以正确含接乳房,母亲也可能面临疼痛、奶量不足、感染或其他并发症。一位评论者提到,一位哺乳顾问甚至没能帮助自己的第一个孩子,这说明提供支持并不一定就能取得成功。 讨论还质疑了“直觉”的含义。有人提出一种区分:反射是自动产生的,本能是与生俱来的行为模式,而直觉性行为则是从过往经验中习得的。婴儿有吸吮反射,但能否成功含接乳房仍取决于发育、姿势和有利条件。更广泛地说,可用性取决于用户后天形成的认知假设,因此没有任何一种界面能对所有人都符合直觉。 一些评论者把这一点延伸到其他自然过程,指出繁殖和育儿即使看似“自然”,也可能非常困难。另一些人则拿 ThinkPad 指点杆、男性乳头和繁殖开玩笑。总之,这场讨论认为,巧妙的标语会掩盖并简化复杂的现实经验。

该基准比较了九种用于提示词注入防护和内容安全的 AI 护栏方案,涵盖小型预训练分类器、零样本分类器、Jev 式决策模型以及 LLM 评审系统。 预训练分类器仍具有很强的竞争力:DeBERTa 在提示词注入检测上的准确率达到 89.01%,中位延迟为 54 毫秒;Granite Guardian 在内容安全方面的准确率达到 80.27%,延迟为 33 毫秒。Qwen3.6-35B 以 89.31% 的准确率取得提示词注入检测最高成绩,而 Jev 以 86.20% 的准确率略微领先内容安全检测。 较新的决策模型也具有竞争力,但在速度、成本和准确率方面并不总是优于传统分类器或 LLM 评审系统。BART-large-mnli 的表现较差,因为其有限的标签无法表达细致的策略要求。Shieldstral 的表现也低于预期,并且对提示词措辞非常敏感。Laya 经过策略调优后,准确率从 57.87% 提升至 75.20%;然而,同一策略却降低了 Jev 的准确率,表明决策模型的提示词具有高度模型特异性。 总体而言,在缺少合适标注数据的情况下,决策模型提供了一种灵活、可复用且由模式驱动的替代方案;但如果有专门的轻量级分类器可用,它们仍是最佳选择。模型选型应依据具体任务的准确率、延迟、基础设施和调优需求,而不应取决于对某种架构的偏爱。

Hacker News 上的一场讨论探讨了红帽的 Jev 决策模型是否优于“LLM 作为评判器”的系统和传统分类器。评论者总结了三种方案之间的权衡:LLM 通用,但相对较慢且成本较高;传统分类器速度快、成本低,但适用范围较窄;Jev 则力求兼顾通用性、速度、成本效益和足够的准确率。 有些人认为该基准过于简单,本质上只是对“阻止/不阻止”进行二分类,并指出更新的 BART 护栏模型可能提供更强的基线。另一些人则认为,在多步推理方面,Jev 优于 Luna 和 GLiDE 等更大的开放模型,同时改善了准确率、校准、延迟和成本。 一个关键技术问题是分布偏移下的可靠校准。神经网络的 logits 可能无法准确反映认知不确定性,因此在后续分支可能偏离训练数据的智能体系统中,高置信度预测往往不稳定。建议的改进方法包括采用相似度—距离—幅度激活,以及构建可解释、可更新且具备不确定性感知能力的分类器。总体而言,具体选择取决于任务复杂度、调用量、延迟和可靠性要求。

本文介绍了一套以 Emacs 和 Org-mode 为核心的静态站点发布流水线。Org 文件是唯一的事实来源,支持可执行源代码块、BibLaTeX 引用和可复现的 d2 图表。该方案不要求站点生成器直接解析 Org,而是由 Gleam 程序调用 Pandoc,将文章转换为 GitHub 风格的 Markdown,并使用小型 Lua 过滤器处理诗歌、参考文献和图片路径。 随后,Gleam、Blogatto 和 Lustre 将 Markdown 转换为经过类型检查的 HTML、RSS 和静态资源。Nix flakes 与 devenv 用于锁定依赖并提供可复现的开发环境;`make run` 和 `make dev` 负责完成整个构建过程。 尽管对于一个简单站点来说,这套技术栈似乎显得过于庞大,但每个工具都承担着明确而专注的角色。作者将这种“有益的臃肿”视为一种连贯的替代方案,可以省去在多个专用编辑器和应用之间切换的麻烦。整套系统的核心仍然是 Emacs:Org-mode 在一个交互式环境中整合了文章写作、代码、计算、结构组织、引用、图表和发布等功能,提供了纯 Markdown 难以自然复现的能力。

```一则关于“使用 Gleam、Org Mode 和 Pandoc 写博客”实验的 Hacker News 讨论。作者表示,这套自定义技术栈提供了模板、语法高亮和 RSS 等实用功能,不过他已经使用 Org 的发布工具维护着另一个博客。 许多评论者认为这套方案过度设计。他们指出,使用 Org Mode、Emacs Lisp、Pandoc 脚本,或者一个简单的 Markdown 转 HTML 流程,同样可以有效发布博客。有些人偏爱 Markdown,因为它的语法更简单,编辑器支持也更广泛;Org 的支持者则称赞它强大且以 Emacs 为中心的工作流。还有人批评 Org 的语法不一致、依赖 Emacs,并且一些边缘情况用起来很别扭。 讨论的一个核心观点是:最好的发布系统,就是能让作者专注于文字,而不是工具本身的工作流。只要已经充分定制过,即使流程比较复杂,它也能减少长期的摩擦,并避免无谓地折腾工具。```

作者评估了 TypeSafe 的 Jev:这是一个低成本“System One”分类器,通过在预训练 Transformer 上附加一个决策头来构建。与自回归大语言模型不同,Jev 会返回带有各选项概率的有类型多选题结果。 在涵盖十种概率分布的一千个基于物理的场景中,Jev 往往能够识别出正确的分布,但其概率校准很差。它的平均总变差误差为 0.518,仅略优于均匀猜测的 0.546。它通常表现得过于尖锐,难以处理逐渐趋近于零的尾部,会给不可能的区间分配概率,并且可能直接利用提示词中明确给出的答案。在公平硬币和骰子问题上,它同样表现得过度自信且存在偏差。 Jev 能够处理相当 advanced 的孤立计算,包括平方根,但会拒绝回答多步骤算术题,并且在追踪十的幂方面尤其困难;单位换算似乎并不是主要问题。作者认为,部分原因在于模型缺少思维链或外部中间存储机制。 这篇文章还警告称,前沿模型可以设计出看似合理的实验,却遗漏致命的实现缺陷——其中一些提示词意外包含了答案,从而把概率校准测试变成了答案抄写测试。

Hacker News 上的一篇讨论质疑,Jev 这个小型概率模型究竟是真正经过了良好校准,还是只是在输出“合理性”分数。 涉及骰子和麦克斯韦–玻尔兹曼分布的测试显示,模型输出与已知概率并不一致,因此人们担心不能信任它的置信度估计。 支持者认为,明确定义的统计问题应该可以作为简单的合理性检验。如果 Jev 无法解决这些问题,那么它声称能够提供概率结果就值得怀疑。他们建议根据任务或领域进行特定校准,并明确说明元不确定性。據报道,在 TRIVIA+ 测试中,期望校准误差从 0.0982 降至 0.0313,而 F1 分数没有明显变化,同时改善了基于置信度的请求分流和升级机制。 批评者则反驳称,Jev 是一个观察型分类器,而不是推理或数学引擎。物理问题可能无法提供有用的训练样本,而连续数值答案也不适合其面向分类的接口。它的用途应该是根据观察到的数据更新置信度,而不是从第一性原理推导事实。 核心区别在于:一方是恢复真实的底层分布,另一方是生成能够可靠反映预测正确频率的置信度分数。

作者结合家庭谈话、中国媒体和个人经历,认为面向中国的理性主义与人工智能安全宣传,可能需要考虑几种文化倾向。这些倾向包括:对社会认可、羞耻和“面子”的强调;网络上的受众反应十分显眼,以及由梗图主导的注意力经济;普遍存在一种类似“暗黑世界”思维的犬儒心理,人们可能更看重力量与不信任,而非善意;民族主义则部分受到历史不安全感以及渴望获得国际认同的影响。 作者还指出,人们对食物新鲜度较为谨慎,却更能容忍人工制作或质量较差的数字媒体,因此,AI生成内容或许契合当地已有的媒体习惯。不过,作者明确说明,这些观察均来自个人经历,受到代际和移民背景的影响,并不代表所有中国人。 对于推动国际人工智能暂停倡议,核心建议是根据当地规范调整信息表达,避免道德说教或“自以为高尚”的姿态,同时在竞争激烈、极为残酷的媒体环境中争夺注意力。

The Hacker News 的一个讨论串围绕一篇文章展开。该文章认为,中国的社会现实——不信任、竞争、“面子”、民族主义、犬儒主义以及低容忍度的流行文化——是由贫困、历史创伤和快速现代化共同塑造的。 许多评论者(包括一些居住在中国的居民)认为,这篇文章有意思,但过于笼统。他们指出,如果把“中国”当作一个整体社会来讨论,就会掩盖中国内部巨大的地区、阶层、代际、城乡和亚文化差异。一些人提出,与其用文化心理学来解释,不如采用更具结构性的解释,例如教育和就业竞争、高考和户籍制度、长工时、文化大革命、市场化改革、审查制度以及政府产业政策。另一些人则强调,决定公共政策和公共话语的是威权政治,而非普通公民的心理。 “同情是一种奢侈”的说法引发了强烈反驳,评论者列举了中国及其他地方贫困社区中相互帮助的例子。他们还指出,西方人看到的只是中国文化中一小部分经过商业化对外输出的内容,而审查和翻译也限制了更多中国文化的传播。有人建议,可以关注中国农村创作者发布、并由人工智能翻译成英语的视频;这些视频或许提供了一个更新、过滤程度更低的窗口,让人得以了解日常生活。版主多次呼吁大家进行具体、尊重的讨论,而不是以民族刻板印象展开争论。

更多

联系我们 contact @ memedata.com