每日HackerNews RSS

Trail of Bits 推出了 SequenceHash 和 SequenceMAC,并通过 C2SP 进行了标准化,使安全的多重哈希能够适用于几乎所有现代密码学哈希函数,而不再局限于 Keccak。 与普通的增量哈希不同,这两种构造会对每个输入进行长度编码,从而避免不同值或不同数据边界拼接后形成相同数据所造成的歧义。 SequenceHash 采用双哈希构造,以抵御长度扩展攻击,并支持使用可选的自定义字符串实现域分离。SequenceMAC 在 HMAC 的基础上实现带密钥的认证哈希,要求密钥长度至少为 32 字节,同时纳入密钥和自定义元数据,以避免密钥伪碰撞和扩展问题。 这两种构造都使用固定宽度的 128 位字节长度后缀编码,支持流式输入,最大可处理 \(2^{128}-1\) 字节的输入。它们的安全性仍取决于底层哈希函数本身,不能解决更广泛的协议问题,例如编码不一致、输入遗漏或模偏差。 Rust、Go 和 Python 均提供了参考实现,并配有规范及大量测试向量,覆盖多种哈希函数和中间值。SequenceXOF 变体仍在考虑中。

``` 黑客新闻 最新 | 往期 | 评论 | 提问 | 展示 | 职位 | 提交 登录 SequenceHash:面向普通用户的多重哈希 ( trailofbits.com ) 33 分 由 tob_scott_a 提交 1 天前 | 隐藏 | 往期 | 收藏 | 讨论 | 帮助 考虑申请 YC 2027 年冬季批次! 申请截止至 11 月 2 日。 指南 | 常见问题 | 列表 | API | 安全 | 法律声明 | 申请加入 YC | 联系我们 搜索: ```

Figure 在保护其专有硬件、同时避免延误 F.04 项目的情况下,退役了 F.02 机器人车队。由于美国和墨西哥的铸造厂拒收采用锂离子电池的机器人,Figure 与阿诺德·施瓦辛格合作,并在芬兰伊马特拉找到了一家愿意接收这些机器人的铸造厂。 团队在模拟环境中训练 F.02 机器人,并以特技演员作为参照,让它们自主跳入盛有 molten steel 的桶中。尽管现场高温严重、存在电磁干扰、电子设备不断故障,熔炼时间也只有六次、每次仅 20 分钟,且机器人只能停留 24 小时,但它们仍成功完成了任务。 回收的钢材被运回美国,并被加工成限量发行的纪念品,为收藏者保留了 F.02 的一部分历史。如今,大多数 F.02 机器人已被销毁,只有少数几台仍留在 Figure 总部。

Figure AI 的“F.02 拆解”视频展示了人形机器人在熔融金属铸造厂中被摧毁的过程,画面包括爆炸、精致的制作,以及让人联想到《终结者》的阿诺德·施瓦辛格客串出场。 《黑客新闻》上的讨论呈现明显分化:许多观众认为视频很有趣、很酷,也是一次有效的营销——Figure 通过销毁卖不出去的库存,成功吸引了关注和投资者兴趣。另一些人则批评,这是一场鲁莽且以《终结者》为主题的公关噱头,掩盖了 Figure 有限的技术进展,也浪费了资源。 怀疑者质疑销毁过程是真实的还是经过策划,以及锂电池和液压油本是否应该引发规模更大的爆炸。据报道,Figure 曾很难找到愿意承担风险的铸造厂,之后又发布了幕后花絮。一些规模较小的讨论则延伸到先进机器人是否可能产生意识、自主性,甚至宗教,并开玩笑讨论未来的“机器人霸主”。 总体而言,即使在那些并不看好 Figure 的人看来,这场视频也被广泛视为一项令人难忘的视觉奇观。

本文分步介绍了一个教材定理的 Lean 4 形式化证明:三行二进制位构成的语言中,若最下面一行等于上面两行之和,则该语言是正则语言。由于 DFA 从左向右读取符号,而二进制加法从最低有效位开始处理更为方便,因此证明构造了一个识别反转语言的 DFA。 该 DFA 有三个状态,分别跟踪进位为 0、进位为 1,以及一个死状态。进位为 0 的状态既是初始状态,也是接受状态,从而防止溢出。 核心证明建立了一个运行不变式,将自动机的执行与任意长度输入上的二进制加法联系起来。归纳过程使用若干辅助引理来拆分运行、将一次转移转化为加法器方程,并在最低有效位处分解整个算术方程。布尔情况通过 `decide` 或 `simp` 处理,线性算术则由 `omega` 求解。 最后,利用 Mathlib 中关于语言反转的封闭性定理,将正则性传递回原语言。本文还指出,形式化验证能够揭示规范中原本未明确写出的要求,同时警告不应盲目信任机器生成的证明,而应确保这些证明仍然易于理解。

讨论的核心在于,Lean 的证明实际上能够保证什么。支持者认为 Assuming a sound Lean kernel, reviewers need not inspect a huge proof body. The kernel verifies every intermediate inference, so humans mainly need to validate the theorem statement, its definitions, permitted axioms, and whether the statement expresses the intended claim. 批评者回应说,这并不能消除语义错误。LLM 生成的形式化证明可能证明了错误的定理,使用了空泛或不成立的假设,引入可疑的公理,或者以非预期的方式定义看似熟悉的概念,例如把“实数”别名定义为复数。这类问题可能出现在同样庞大的定理陈述或配套定义中,因此,成功通过编译并不等同于验证了现实世界中的主张。内核的可靠性漏洞以及建模方式的选择,也仍然是值得关注的问题。 另一个次要争议涉及如何学习 Lean:一些评论者建议先理解依赖类型论、构造逻辑和柯里–霍华德对应;另一些人则主张从实践练习和官方社区资源开始。总体而言,Lean 减轻了证明检查的负担,但并没有消除验证规格是否名副其实的必要性。

请启用 JavaScript 和 Cookie 以继续访问。

Hacker News 上的一篇讨论帖介绍了一篇 Big Think 文章。该文章声称,威尼斯在 12 世纪与君士坦丁堡的战争促成了世界上第一个公共债券市场。评论者将威尼斯大规模借款与其资助第四次十字军东征联系起来,认为拜占庭方面中途改变资金用途,将借款用于追讨债务和复仇,最终导致威尼斯在 1204 年攻陷并洗劫君士坦丁堡。讨论还涉及这给拜占庭与威尼斯关系造成的破坏,以及威尼斯后来与奥斯曼帝国的冲突。 几位评论者质疑文章使用“第一个债券市场”这一说法。他们认为,威尼斯在 1172 年推出的 prestiti 只是公共债券市场的先驱,而非成熟的市场;其长期公共债务直到 1262 年才得到整合,而比萨和热那亚更早也有类似的债务安排。其他一些说法,包括中世纪人口数字以及威尼斯政治转型的性质,也被认为过于简化。 随后,讨论范围扩展到政府借款、中央银行独立性、量化宽松、货币创造、通胀与通缩,以及债券市场究竟主要是为政府融资,还是用于配置资本和分散风险。帖中还辩论了多种历史和经济类比,而不同参与者往往基于明显不同的政治立场得出结论。

伊丽莎白·考玛讲述了家里传承下来的手工钩针编织品。这些作品曾差点被丢弃,如今却被保存下来,也让人得以看见纤维艺术背后鲜为人知的劳动。她追溯了编织的发展历程:从中世纪由男性主导的行会和维持生计的劳动,逐渐发展至针织业以及框架编织机的发明。随着机械化取代许多手工编织者,编织逐渐转变为一种休闲活动,并与维多利亚时期的上层阶级女性联系起来。 后来出现的钩针编织,最初曾在客厅社交中与编织针编织相竞争,后来尤其擅长制作蕾丝。尽管钩针编织多年 resists 机械化,但现代蕾丝机和编织机已经能够仿制钩针编织的效果。考玛解释了如何辨别真正的手工钩针作品:观察针法结构和衣物内部;机器制作或刺绣而成的仿品,内部往往会露出网状结构或不同的针法。 本期节目将这些工艺史与自动化、时尚、性别、阶级和道德消费等更广泛的问题联系起来,并推荐那些与手工钩针编织者合作的品牌。

# 黑客新闻 最新 | 往期 | 评论 | 提问 | 分享 | 职位 | 提交 登录 **蕾丝与劳动:来自真正的卢德分子的教训** (articlesofinterest.substack.com) 13 分 作者:surprisetalk 1 天前 隐藏 | 往期 | 收藏 | 1 条评论 帮助 vonStackelberg 1 天前 [–] 哦,很高兴看到这里提到了这件事。这些播客都很棒,不过这一期我还没听。关于拉链的那一期非常 entertaining。她还制作了一系列探讨军工与户外服装行业相互依赖关系的节目。内容很精彩! 回复 考虑申请 YC 的 2027 年冬季批次! 申请截至 11 月 2 日。 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请加入 YC | 联系我们 搜索:

关于 媒体 版权 联系我们 创作者 广告合作 开发者 条款 隐私 政策与安全 YouTube 的运作方式 测试新功能 © 2026 Google LLC

讨论探讨了 AI 和其他大规模计算是否能在 CPU 上比 GPU 上执行得更高效。评论者指出,GPU 擅长高度并行的矩阵运算,但紧密耦合的硬件和 CUDA 软件生态会促使开发者手动优化代码,降低灵活性,并可能妨碍采用稀疏计算或更高抽象层次的编程方法。CPU 可能具有更大的内存容量,也更易于编程,但传统上同时执行的操作较少。 其他人还提到了英特尔的 Larrabee 项目以及后来推出的 AVX/AVX-512 向量指令集,认为这些项目试图让 CPU 具备类似 GPU 的能力,并指出矩阵计算领域仍有许多潜力未被探索。 苹果的统一内存架构被强调为一项重大优势:CPU 和 GPU 共享内存,从而避免了通过 PCIe 传输数据时开销高昂的复制。这得益于苹果对硬件、操作系统、缓存、互连以及整个软件栈的掌控。英伟达的 Grace Hopper 也提供了类似的集成方案,但牺牲了模块化能力。最后的问题在于,采用一种开放且更高速的标准互连,是否能让传统 CPU/GPU 系统获得类似优势,而无需由单一厂商控制整个平台。

这篇文章追溯了“唯一凭直觉就能使用的界面就是乳头”这一说法的来源。人们通常认为这句话出自布鲁斯·埃迪格,但他否认是自己发明的。早在1994年8月,斯科特·弗朗西斯就在一篇帖子中提出了这一概念。1995年1月,杰·沃尔默也给出了几乎相同的表述:“实际上,唯一真正凭直觉就能使用的界面就是乳头。”从1995年2月起,埃迪格开始使用类似说法,其中包括:“除此之外,一切都得靠学习。”他究竟是沿用了沃尔默的措辞,还是从其他地方看到了这个想法,目前并不清楚。作者认为,埃迪格最有资格被视为人们熟悉的那种说法的来源,但作者更喜欢他后来更为讽刺的版本:“根本不存在凭直觉就能使用的界面,连乳头也不例外。一切都得靠学习。”

Hacker News 上的一则讨论质疑了“唯一符合直觉的界面就是乳头”这一说法。许多父母和哺乳专业人员指出,母乳喂养并不总是符合直觉:婴儿可能难以正确含接乳房,母亲也可能面临疼痛、奶量不足、感染或其他并发症。一位评论者提到,一位哺乳顾问甚至没能帮助自己的第一个孩子,这说明提供支持并不一定就能取得成功。 讨论还质疑了“直觉”的含义。有人提出一种区分:反射是自动产生的,本能是与生俱来的行为模式,而直觉性行为则是从过往经验中习得的。婴儿有吸吮反射,但能否成功含接乳房仍取决于发育、姿势和有利条件。更广泛地说,可用性取决于用户后天形成的认知假设,因此没有任何一种界面能对所有人都符合直觉。 一些评论者把这一点延伸到其他自然过程,指出繁殖和育儿即使看似“自然”,也可能非常困难。另一些人则拿 ThinkPad 指点杆、男性乳头和繁殖开玩笑。总之,这场讨论认为,巧妙的标语会掩盖并简化复杂的现实经验。

该基准比较了九种用于提示词注入防护和内容安全的 AI 护栏方案,涵盖小型预训练分类器、零样本分类器、Jev 式决策模型以及 LLM 评审系统。 预训练分类器仍具有很强的竞争力:DeBERTa 在提示词注入检测上的准确率达到 89.01%,中位延迟为 54 毫秒;Granite Guardian 在内容安全方面的准确率达到 80.27%,延迟为 33 毫秒。Qwen3.6-35B 以 89.31% 的准确率取得提示词注入检测最高成绩,而 Jev 以 86.20% 的准确率略微领先内容安全检测。 较新的决策模型也具有竞争力,但在速度、成本和准确率方面并不总是优于传统分类器或 LLM 评审系统。BART-large-mnli 的表现较差,因为其有限的标签无法表达细致的策略要求。Shieldstral 的表现也低于预期,并且对提示词措辞非常敏感。Laya 经过策略调优后,准确率从 57.87% 提升至 75.20%;然而,同一策略却降低了 Jev 的准确率,表明决策模型的提示词具有高度模型特异性。 总体而言,在缺少合适标注数据的情况下,决策模型提供了一种灵活、可复用且由模式驱动的替代方案;但如果有专门的轻量级分类器可用,它们仍是最佳选择。模型选型应依据具体任务的准确率、延迟、基础设施和调优需求,而不应取决于对某种架构的偏爱。

一场 Hacker News 上的讨论围绕 Jev 式决策模型是否优于基于大语言模型的评判器和传统分类器展开。评论者认为,现有基准过于简单,尤其难以评估多步骤推理能力;而 Jev 的开发者声称,在更复杂的任务上,Jev 在准确率、校准效果、速度和成本方面都优于 Luna、GLiDE 等模型。 更广泛来看,需要权衡通用性、准确性和运营成本。传统分类器仍非常适合垃圾邮件检测这类定义明确且处理量大的任务;大语言模型灵活性更高,但相对更慢、成本更高;决策模型则可能为新颖的分类问题提供一种有用的折中方案。其他评论者强调,智能体系统不仅需要出色的基准准确率,还需要可靠的置信度估计、有信息量的预测,以及对分布变化的鲁棒性。

本文介绍了一套以 Emacs 和 Org-mode 为核心的静态站点发布流水线。Org 文件是唯一的事实来源,支持可执行源代码块、BibLaTeX 引用和可复现的 d2 图表。该方案不要求站点生成器直接解析 Org,而是由 Gleam 程序调用 Pandoc,将文章转换为 GitHub 风格的 Markdown,并使用小型 Lua 过滤器处理诗歌、参考文献和图片路径。 随后,Gleam、Blogatto 和 Lustre 将 Markdown 转换为经过类型检查的 HTML、RSS 和静态资源。Nix flakes 与 devenv 用于锁定依赖并提供可复现的开发环境;`make run` 和 `make dev` 负责完成整个构建过程。 尽管对于一个简单站点来说,这套技术栈似乎显得过于庞大,但每个工具都承担着明确而专注的角色。作者将这种“有益的臃肿”视为一种连贯的替代方案,可以省去在多个专用编辑器和应用之间切换的麻烦。整套系统的核心仍然是 Emacs:Org-mode 在一个交互式环境中整合了文章写作、代码、计算、结构组织、引用、图表和发布等功能,提供了纯 Markdown 难以自然复现的能力。

```一则关于“使用 Gleam、Org Mode 和 Pandoc 写博客”实验的 Hacker News 讨论。作者表示,这套自定义技术栈提供了模板、语法高亮和 RSS 等实用功能,不过他已经使用 Org 的发布工具维护着另一个博客。 许多评论者认为这套方案过度设计。他们指出,使用 Org Mode、Emacs Lisp、Pandoc 脚本,或者一个简单的 Markdown 转 HTML 流程,同样可以有效发布博客。有些人偏爱 Markdown,因为它的语法更简单,编辑器支持也更广泛;Org 的支持者则称赞它强大且以 Emacs 为中心的工作流。还有人批评 Org 的语法不一致、依赖 Emacs,并且一些边缘情况用起来很别扭。 讨论的一个核心观点是:最好的发布系统,就是能让作者专注于文字,而不是工具本身的工作流。只要已经充分定制过,即使流程比较复杂,它也能减少长期的摩擦,并避免无谓地折腾工具。```

作者评估了 TypeSafe 的 Jev:这是一个低成本“System One”分类器,通过在预训练 Transformer 上附加一个决策头来构建。与自回归大语言模型不同,Jev 会返回带有各选项概率的有类型多选题结果。 在涵盖十种概率分布的一千个基于物理的场景中,Jev 往往能够识别出正确的分布,但其概率校准很差。它的平均总变差误差为 0.518,仅略优于均匀猜测的 0.546。它通常表现得过于尖锐,难以处理逐渐趋近于零的尾部,会给不可能的区间分配概率,并且可能直接利用提示词中明确给出的答案。在公平硬币和骰子问题上,它同样表现得过度自信且存在偏差。 Jev 能够处理相当 advanced 的孤立计算,包括平方根,但会拒绝回答多步骤算术题,并且在追踪十的幂方面尤其困难;单位换算似乎并不是主要问题。作者认为,部分原因在于模型缺少思维链或外部中间存储机制。 这篇文章还警告称,前沿模型可以设计出看似合理的实验,却遗漏致命的实现缺陷——其中一些提示词意外包含了答案,从而把概率校准测试变成了答案抄写测试。

Hacker News 上的一篇讨论质疑,Jev 这个小型概率模型究竟是真正经过了良好校准,还是只是在输出“合理性”分数。 涉及骰子和麦克斯韦–玻尔兹曼分布的测试显示,模型输出与已知概率并不一致,因此人们担心不能信任它的置信度估计。 支持者认为,明确定义的统计问题应该可以作为简单的合理性检验。如果 Jev 无法解决这些问题,那么它声称能够提供概率结果就值得怀疑。他们建议根据任务或领域进行特定校准,并明确说明元不确定性。據报道,在 TRIVIA+ 测试中,期望校准误差从 0.0982 降至 0.0313,而 F1 分数没有明显变化,同时改善了基于置信度的请求分流和升级机制。 批评者则反驳称,Jev 是一个观察型分类器,而不是推理或数学引擎。物理问题可能无法提供有用的训练样本,而连续数值答案也不适合其面向分类的接口。它的用途应该是根据观察到的数据更新置信度,而不是从第一性原理推导事实。 核心区别在于:一方是恢复真实的底层分布,另一方是生成能够可靠反映预测正确频率的置信度分数。

更多

联系我们 contact @ memedata.com