每日HackerNews RSS

Trail of Bits 推出了 SequenceHash 和 SequenceMAC,并通过 C2SP 进行了标准化,使安全的多重哈希能够适用于几乎所有现代密码学哈希函数,而不再局限于 Keccak。 与普通的增量哈希不同,这两种构造会对每个输入进行长度编码,从而避免不同值或不同数据边界拼接后形成相同数据所造成的歧义。 SequenceHash 采用双哈希构造,以抵御长度扩展攻击,并支持使用可选的自定义字符串实现域分离。SequenceMAC 在 HMAC 的基础上实现带密钥的认证哈希,要求密钥长度至少为 32 字节,同时纳入密钥和自定义元数据,以避免密钥伪碰撞和扩展问题。 这两种构造都使用固定宽度的 128 位字节长度后缀编码,支持流式输入,最大可处理 \(2^{128}-1\) 字节的输入。它们的安全性仍取决于底层哈希函数本身,不能解决更广泛的协议问题,例如编码不一致、输入遗漏或模偏差。 Rust、Go 和 Python 均提供了参考实现,并配有规范及大量测试向量,覆盖多种哈希函数和中间值。SequenceXOF 变体仍在考虑中。

``` 黑客新闻 最新 | 往期 | 评论 | 提问 | 展示 | 职位 | 提交 登录 SequenceHash:面向普通用户的多重哈希 ( trailofbits.com ) 33 分 由 tob_scott_a 提交 1 天前 | 隐藏 | 往期 | 收藏 | 讨论 | 帮助 考虑申请 YC 2027 年冬季批次! 申请截止至 11 月 2 日。 指南 | 常见问题 | 列表 | API | 安全 | 法律声明 | 申请加入 YC | 联系我们 搜索: ```

Figure 在保护其专有硬件、同时避免延误 F.04 项目的情况下,退役了 F.02 机器人车队。由于美国和墨西哥的铸造厂拒收采用锂离子电池的机器人,Figure 与阿诺德·施瓦辛格合作,并在芬兰伊马特拉找到了一家愿意接收这些机器人的铸造厂。 团队在模拟环境中训练 F.02 机器人,并以特技演员作为参照,让它们自主跳入盛有 molten steel 的桶中。尽管现场高温严重、存在电磁干扰、电子设备不断故障,熔炼时间也只有六次、每次仅 20 分钟,且机器人只能停留 24 小时,但它们仍成功完成了任务。 回收的钢材被运回美国,并被加工成限量发行的纪念品,为收藏者保留了 F.02 的一部分历史。如今,大多数 F.02 机器人已被销毁,只有少数几台仍留在 Figure 总部。

Hacker News 用户讨论了 Figure AI 发布的一段视频:视频中,F.02 人形机器人被丢进芬兰伊马特拉一家铸造厂的熔融金属里。各方反应截然不同:许多人认为这是一场视觉震撼、滑稽且有效的营销活动,把原本过时、无人问津的库存变成了引发病毒式传播的宣传素材。另一些人则批评此举鲁莽、对环境不负责任、浪费资源,并认为这表明 Figure 更看重吸引注意力,而非研发实用的机器人技术。 一些评论者质疑这场活动是摆拍还是真实发生的,指出其拍摄手法 dramatic,明显带有《终结者》的风格,而且还有阿诺德·施瓦辛格客串。另一场相关讨论涉及 AI 是否具有感知能力:有人认为先进的 AI 智能体可能会体验情绪或痛苦;也有人指出,F.02 机器人可能不具备类似人类的疼痛反应或自我保护本能。怀疑者还质疑 Figure 的技术进展,认为这种宣传可能主要让投资者受益,而不是让客户受益。

本文分步介绍了一个教材定理的 Lean 4 形式化证明:三行二进制位构成的语言中,若最下面一行等于上面两行之和,则该语言是正则语言。由于 DFA 从左向右读取符号,而二进制加法从最低有效位开始处理更为方便,因此证明构造了一个识别反转语言的 DFA。 该 DFA 有三个状态,分别跟踪进位为 0、进位为 1,以及一个死状态。进位为 0 的状态既是初始状态,也是接受状态,从而防止溢出。 核心证明建立了一个运行不变式,将自动机的执行与任意长度输入上的二进制加法联系起来。归纳过程使用若干辅助引理来拆分运行、将一次转移转化为加法器方程,并在最低有效位处分解整个算术方程。布尔情况通过 `decide` 或 `simp` 处理,线性算术则由 `omega` 求解。 最后,利用 Mathlib 中关于语言反转的封闭性定理,将正则性传递回原语言。本文还指出,形式化验证能够揭示规范中原本未明确写出的要求,同时警告不应盲目信任机器生成的证明,而应确保这些证明仍然易于理解。

讨论的核心在于,Lean 的证明实际上能够保证什么。支持者认为 Assuming a sound Lean kernel, reviewers need not inspect a huge proof body. The kernel verifies every intermediate inference, so humans mainly need to validate the theorem statement, its definitions, permitted axioms, and whether the statement expresses the intended claim. 批评者回应说,这并不能消除语义错误。LLM 生成的形式化证明可能证明了错误的定理,使用了空泛或不成立的假设,引入可疑的公理,或者以非预期的方式定义看似熟悉的概念,例如把“实数”别名定义为复数。这类问题可能出现在同样庞大的定理陈述或配套定义中,因此,成功通过编译并不等同于验证了现实世界中的主张。内核的可靠性漏洞以及建模方式的选择,也仍然是值得关注的问题。 另一个次要争议涉及如何学习 Lean:一些评论者建议先理解依赖类型论、构造逻辑和柯里–霍华德对应;另一些人则主张从实践练习和官方社区资源开始。总体而言,Lean 减轻了证明检查的负担,但并没有消除验证规格是否名副其实的必要性。

请启用 JavaScript 和 Cookie 以继续访问。

一则 Hacker News 讨论涉及 Big Think 的一篇文章,该文章声称,威尼斯对君士坦丁堡的战争失败催生了全球第一个债券市场。评论者将1172年的贷款与威尼斯资助第四次十字军东征,并将十字军引向君士坦丁堡洗劫一事联系起来。他们认为,这一事件削弱了拜占庭帝国,并为威尼斯后来的扩张创造了条件。 不少人对文章的历史叙述提出异议:比萨和热那亚更早就有债务安排;威尼斯统一后的公共债务可追溯至1262年;有关“世界首个”市场、政府机构以及中世纪人口数字的说法也可能夸大了事实。 另一场讨论围绕现代债券和法定货币展开。参与者质疑,既然主权政府可以发行本币,是否还需要债券市场;也有人认为,债券能够分配风险、提供投资工具、维护货币信誉,并约束政府支出。关于美联储独立性和量化宽松的讨论进一步引出了通胀与通缩之争:通胀可以为经济活动提供资金、减轻实际债务负担,但它也构成一种隐性税收;通缩则能保住购买力,却会加剧失业、债务压力和政治不稳定。

伊丽莎白·考玛讲述了家里传承下来的手工钩针编织品。这些作品曾差点被丢弃,如今却被保存下来,也让人得以看见纤维艺术背后鲜为人知的劳动。她追溯了编织的发展历程:从中世纪由男性主导的行会和维持生计的劳动,逐渐发展至针织业以及框架编织机的发明。随着机械化取代许多手工编织者,编织逐渐转变为一种休闲活动,并与维多利亚时期的上层阶级女性联系起来。 后来出现的钩针编织,最初曾在客厅社交中与编织针编织相竞争,后来尤其擅长制作蕾丝。尽管钩针编织多年 resists 机械化,但现代蕾丝机和编织机已经能够仿制钩针编织的效果。考玛解释了如何辨别真正的手工钩针作品:观察针法结构和衣物内部;机器制作或刺绣而成的仿品,内部往往会露出网状结构或不同的针法。 本期节目将这些工艺史与自动化、时尚、性别、阶级和道德消费等更广泛的问题联系起来,并推荐那些与手工钩针编织者合作的品牌。

# 黑客新闻 最新 | 往期 | 评论 | 提问 | 分享 | 职位 | 提交 登录 **蕾丝与劳动:来自真正的卢德分子的教训** (articlesofinterest.substack.com) 13 分 作者:surprisetalk 1 天前 隐藏 | 往期 | 收藏 | 1 条评论 帮助 vonStackelberg 1 天前 [–] 哦,很高兴看到这里提到了这件事。这些播客都很棒,不过这一期我还没听。关于拉链的那一期非常 entertaining。她还制作了一系列探讨军工与户外服装行业相互依赖关系的节目。内容很精彩! 回复 考虑申请 YC 的 2027 年冬季批次! 申请截至 11 月 2 日。 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请加入 YC | 联系我们 搜索:

关于 媒体 版权 联系我们 创作者 广告合作 开发者 条款 隐私 政策与安全 YouTube 的运作方式 测试新功能 © 2026 Google LLC

讨论探讨了 AI 和其他大规模计算是否能在 CPU 上比 GPU 上执行得更高效。评论者指出,GPU 擅长高度并行的矩阵运算,但紧密耦合的硬件和 CUDA 软件生态会促使开发者手动优化代码,降低灵活性,并可能妨碍采用稀疏计算或更高抽象层次的编程方法。CPU 可能具有更大的内存容量,也更易于编程,但传统上同时执行的操作较少。 其他人还提到了英特尔的 Larrabee 项目以及后来推出的 AVX/AVX-512 向量指令集,认为这些项目试图让 CPU 具备类似 GPU 的能力,并指出矩阵计算领域仍有许多潜力未被探索。 苹果的统一内存架构被强调为一项重大优势:CPU 和 GPU 共享内存,从而避免了通过 PCIe 传输数据时开销高昂的复制。这得益于苹果对硬件、操作系统、缓存、互连以及整个软件栈的掌控。英伟达的 Grace Hopper 也提供了类似的集成方案,但牺牲了模块化能力。最后的问题在于,采用一种开放且更高速的标准互连,是否能让传统 CPU/GPU 系统获得类似优势,而无需由单一厂商控制整个平台。

这篇文章追溯了“唯一凭直觉就能使用的界面就是乳头”这一说法的来源。人们通常认为这句话出自布鲁斯·埃迪格,但他否认是自己发明的。早在1994年8月,斯科特·弗朗西斯就在一篇帖子中提出了这一概念。1995年1月,杰·沃尔默也给出了几乎相同的表述:“实际上,唯一真正凭直觉就能使用的界面就是乳头。”从1995年2月起,埃迪格开始使用类似说法,其中包括:“除此之外,一切都得靠学习。”他究竟是沿用了沃尔默的措辞,还是从其他地方看到了这个想法,目前并不清楚。作者认为,埃迪格最有资格被视为人们熟悉的那种说法的来源,但作者更喜欢他后来更为讽刺的版本:“根本不存在凭直觉就能使用的界面,连乳头也不例外。一切都得靠学习。”

一场 Hacker News 讨论质疑了“唯一符合直觉的界面是乳头”这一说法。许多父母和哺乳专家指出,母乳喂养并非天然容易:婴儿可能难以正确含乳,母亲也可能出现奶水不足、感染、疼痛或其他需要专业帮助的医疗问题。 其他人则强调,直觉是相对的,并非绝对。人们会通过经验熟悉各种模式,因此,一个设计对某位用户来说可能很直观,对另一个人却可能令人困惑。评论者还区分了反射、本能和后天习得的行为,并指出,即使是成功触发的反射,也需要有利条件。 一些关于动物无法哺乳或保护幼崽的 anecdotes,进一步说明进化并不保证繁殖毫无障碍,也不保证父母一定称职。关于 ThinkPad 小红点、人体解剖和性繁殖的玩笑让讨论轻松了一些,但总体结论是:那句话虽然很吸引人,却过于简化——世上没有任何事物是 universally intuitive,而“直观”也不一定意味着容易或可靠。

该基准比较了九种用于提示词注入防护和内容安全的 AI 护栏方案,涵盖小型预训练分类器、零样本分类器、Jev 式决策模型以及 LLM 评审系统。 预训练分类器仍具有很强的竞争力:DeBERTa 在提示词注入检测上的准确率达到 89.01%,中位延迟为 54 毫秒;Granite Guardian 在内容安全方面的准确率达到 80.27%,延迟为 33 毫秒。Qwen3.6-35B 以 89.31% 的准确率取得提示词注入检测最高成绩,而 Jev 以 86.20% 的准确率略微领先内容安全检测。 较新的决策模型也具有竞争力,但在速度、成本和准确率方面并不总是优于传统分类器或 LLM 评审系统。BART-large-mnli 的表现较差,因为其有限的标签无法表达细致的策略要求。Shieldstral 的表现也低于预期,并且对提示词措辞非常敏感。Laya 经过策略调优后,准确率从 57.87% 提升至 75.20%;然而,同一策略却降低了 Jev 的准确率,表明决策模型的提示词具有高度模型特异性。 总体而言,在缺少合适标注数据的情况下,决策模型提供了一种灵活、可复用且由模式驱动的替代方案;但如果有专门的轻量级分类器可用,它们仍是最佳选择。模型选型应依据具体任务的准确率、延迟、基础设施和调优需求,而不应取决于对某种架构的偏爱。

一场 Hacker News 上的讨论围绕 Jev 式决策模型是否优于基于大语言模型的评判器和传统分类器展开。评论者认为,现有基准过于简单,尤其难以评估多步骤推理能力;而 Jev 的开发者声称,在更复杂的任务上,Jev 在准确率、校准效果、速度和成本方面都优于 Luna、GLiDE 等模型。 更广泛来看,需要权衡通用性、准确性和运营成本。传统分类器仍非常适合垃圾邮件检测这类定义明确且处理量大的任务;大语言模型灵活性更高,但相对更慢、成本更高;决策模型则可能为新颖的分类问题提供一种有用的折中方案。其他评论者强调,智能体系统不仅需要出色的基准准确率,还需要可靠的置信度估计、有信息量的预测,以及对分布变化的鲁棒性。

本文介绍了一套以 Emacs 和 Org-mode 为核心的静态站点发布流水线。Org 文件是唯一的事实来源,支持可执行源代码块、BibLaTeX 引用和可复现的 d2 图表。该方案不要求站点生成器直接解析 Org,而是由 Gleam 程序调用 Pandoc,将文章转换为 GitHub 风格的 Markdown,并使用小型 Lua 过滤器处理诗歌、参考文献和图片路径。 随后,Gleam、Blogatto 和 Lustre 将 Markdown 转换为经过类型检查的 HTML、RSS 和静态资源。Nix flakes 与 devenv 用于锁定依赖并提供可复现的开发环境;`make run` 和 `make dev` 负责完成整个构建过程。 尽管对于一个简单站点来说,这套技术栈似乎显得过于庞大,但每个工具都承担着明确而专注的角色。作者将这种“有益的臃肿”视为一种连贯的替代方案,可以省去在多个专用编辑器和应用之间切换的麻烦。整套系统的核心仍然是 Emacs:Org-mode 在一个交互式环境中整合了文章写作、代码、计算、结构组织、引用、图表和发布等功能,提供了纯 Markdown 难以自然复现的能力。

一场关于自定义博客发布流程的讨论引发 了争论。这套流程结合了 Gleam、Org-mode、Pandoc、Emacs Lisp 和 Nix,但人们质疑如此高的复杂度是否合理。作者将其视为一项实验,并认为它能提供语法高亮和 RSS 等实用功能。评论者则指出,Org-mode 只需很少的代码就能发布 HTML,而 Markdown 配合 Pandoc 可能更加简单。WordPress 和 Ghost 也被推荐为无需维护的替代方案,但它们在安全性和编辑器功能方面的不足遭到了批评。 Emacs 用户强调,Org-mode 能保留他们熟悉的工具和操作习惯,让作者专注于写作。用户对 Org 与 Markdown 的比较同样存在分歧:Org 提供了更丰富的组织能力和 Emacs 集成,但有时显得笨重、依赖 Emacs,而且不太适合某些博客内容;Markdown 则更简单,也更具可移植性。 总体而言,共识是:最好的博客技术栈,就是那个能帮助作者持续写下去的方案,即使它看起来复杂得有些“拜占庭式”。

作者评估了 TypeSafe 的 Jev:这是一个低成本“System One”分类器,通过在预训练 Transformer 上附加一个决策头来构建。与自回归大语言模型不同,Jev 会返回带有各选项概率的有类型多选题结果。 在涵盖十种概率分布的一千个基于物理的场景中,Jev 往往能够识别出正确的分布,但其概率校准很差。它的平均总变差误差为 0.518,仅略优于均匀猜测的 0.546。它通常表现得过于尖锐,难以处理逐渐趋近于零的尾部,会给不可能的区间分配概率,并且可能直接利用提示词中明确给出的答案。在公平硬币和骰子问题上,它同样表现得过度自信且存在偏差。 Jev 能够处理相当 advanced 的孤立计算,包括平方根,但会拒绝回答多步骤算术题,并且在追踪十的幂方面尤其困难;单位换算似乎并不是主要问题。作者认为,部分原因在于模型缺少思维链或外部中间存储机制。 这篇文章还警告称,前沿模型可以设计出看似合理的实验,却遗漏致命的实现缺陷——其中一些提示词意外包含了答案,从而把概率校准测试变成了答案抄写测试。

该讨论涉及 **Jev**——一个基于语言模型的小型快速分类器,用于为可能的答案输出概率。一项基准测试发现,在具有已知概率分布的问题上,例如麦克斯韦–玻尔兹曼速度分布或公平骰子,Jev 输出的分数看似合理,却并非准确概率,因此人们质疑其概率校准能力。 支持者认为,这些测试超出了 Jev 的预期适用范围。它针对的是自然语言分类而优化,并不适用于数学推理、连续数值输出或物理约束的 enforcement。他们指出,Jev 在常规自然语言处理任务上的初步测试表明,其校准表现尚可;而且,它的速度优势来自使用了非常小的模型。 另一些人则坚持认为,即使是简单的概率问题也属于有效测试,而 Jev 的核心价值主张就是提供可信的概率。如果这些输出还需要大量事后校准,那么这一主张就会被削弱。一位评论者报告称,校准将 Jev 在 TRIVIA+ 上的期望校准误差从 0.0982 降至 0.0313,同时没有明显改变 F1 分数,使置信度得分更适合用于任务路由和升级处理。 尚未解决的问题是:Jev 能否进行全局校准,还是只能在特定任务和领域内进行校准。

更多

联系我们 contact @ memedata.com