每日HackerNews RSS

今天,我推出了 I ♥ RSS,这是一个专为 RSS 爱好者打造的目录。我已经将徽章添加到我的页脚,并把我的网站提交到了该目录。它的首页还展示了一个精美的实时博客列表(由 FeedLand 提供支持)。如果你也像我一样热爱 RSS,不妨去看看并添加你自己的网站。发布于 2026 年 7 月 30 日。

本研究通过在 Intel Xeon E-2236 上使用 `gcc -ffixed-<reg>` 逐步限制寄存器资源,探讨了寄存器压力对九个 C 语言内核性能的影响。 **主要发现:** * **性能影响:** 在寄存器资源最紧张的情况下,九个内核中有八个的性能下降了 14% 至 76%。SipHash-2-4 未受影响,这表明寄存器压力在很大程度上取决于内核特性。 * **可预测性:** 静态溢出计数对运行时间成本的预测能力较弱(皮尔逊相关系数 r = 0.55)。每次溢出的代价差异可达 30 倍,因为处于关键路径之外的溢出通常会被驻留在 L1 缓存的栈和乱序执行机制所掩盖。 * **寄存器文件特异性:** 性能下降与内核所使用的特定寄存器文件(通用寄存器或 XMM 寄存器)相关。然而,编译器行为(如自动向量化)可能会导致原本看似无关的寄存器文件中出现意外的溢出增加。 * **历史背景:** 尽管现代乱序执行 CPU 掩盖了大部分寄存器溢出的代价,但早期的顺序执行硬件对于循环密集型代码可能会遭受更严重的性能损失。 本研究结论认为,即使在单一架构和编译器内,寄存器分配和溢出的代价也非常微妙,且并非简单的单调关系。

请启用 JavaScript 并关闭所有广告拦截器

近期,美国多个州(包括明尼苏达州)针对供水和废水处理设施的网络攻击激增,引发了对伊朗可能参与其中的调查。联邦调查局(FBI)和美国环保署(EPA)等联邦机构报告称,恶意攻击者正利用面向互联网的运营技术(OT)(例如可编程逻辑控制器,即PLC),通过更改密码和IP地址来破坏监控和控制能力。 《黑客新闻》(The Hacker News)关于这些事件的讨论主要集中在两个方面。首先,安全专家指出,由于网络安全实践薄弱,许多市政供水系统仍处于极其危险的暴露状态,例如未能将关键控制系统与公共互联网隔离,这通常是由资源匮乏或技术疏忽导致的。其次,社区对地缘政治影响的看法存在严重分歧。一些用户认为这些攻击是美伊关系日益紧张的结果;另一些用户则讨论了现有安全措施的有效性、政府监管的作用,以及政治人物倾向于责怪地方管理人员而非解决基础设施结构性漏洞的现象。许多贡献者强调,无论肇事者是谁,根本问题在于未能建立完善的系统性防范机制,以保护关键基础设施免受可预防的低门槛攻击。

**探索式建模 (Explorative Modeling, XM)** 引入了一种新的生成式建模范式,将复杂训练目标的负担从“分解生成”(如扩散模型等多步过程)转移到了“分解训练”(探索)上。 传统的生成模型往往因为试图预测多种有效输出的平均值而失败,导致生成结果模糊且质量低下。目前的解决方案(如扩散模型或自回归模型)通过将生成过程拆解为许多小而可预测的步骤来解决这一问题,但这造成了“暴露偏差”,并阻碍了真正的端到端学习。 XM 通过引入**生成表达力 (generative expressivity)** 作为继参数和数据之外的第三个预训练维度,解决了上述问题。在训练过程中,XM 模型会生成 $K$ 个潜在输出,仅针对与真实值匹配度最高的那一个进行训练。这鼓励模型专注于独特的、高质量的数据点,而不是对它们进行平均。 **主要优势:** * **效率:** XM 在样本效率(6.2倍)、算力效率(FLOP,4.1倍)和参数效率方面均有显著提升。 * **可扩展性:** 随着模型和数据规模的扩大,性能提升愈加显著。 * **端到端性能:** 在控制任务中,XM 在减少高达 256 倍推理计算量的情况下,达到了与扩散模型相当的性能;通过消除迭代推理步骤,实现了真正的端到端生成。

关于“探索性建模:在K个猜测中选择最优进行训练”(Explorative Modeling: Train on the best of K guesses)的 Hacker News 讨论呈现出两极分化的观点。虽然一些用户称赞该方法是一种简单且有效地捕捉生成模型中多模态分布的技巧,但许多资深评论者认为该论文显著夸大了其创新性。 批评者指出,其核心机制——即采样多个候选结果并选择最优项——与重要性加权自编码器(IWAE)、Best-of-N 采样以及近期的离散分布网络等既有技术非常相似。一些用户质疑作者关于“传统生成模型因缺乏因子分解而导致模糊”的前提,并指出当前方法已通过建模输出分布而非点估计解决了这一问题。 此外,技术层面也引发了争论,一些人指出该方法存在训练期间计算成本增加及采样行为不佳等潜在缺点。虽然支持者认为这是提升模型性能的一个有前景的“切入点”,但怀疑论者并不认为该工作提供了根本性的突破,认为这更多是一种渐进式的扩展策略,而非范式转移。

Spotify 正面临一个日益严峻的挑战:在线服务和人工智能代理需要从其“数据湖”的艾字节(exabyte)级数据中,进行亚秒级的“点查询”(即查找特定用户的数据)。虽然云存储延迟已大幅降低,但像 Trino 或 BigQuery 这样的标准查询引擎主要针对分析型吞吐量进行了优化,而非单行查找。 随机访问 Parquet(Random Access Parquet,简称 RAP)通过直接在现有 Parquet 文件上实现交互式查询,填补了这一空白,且无需数据冗余或专门的键值(KV)存储。 RAP 使用“外部索引”将键(如 `user_id`)直接映射到文件位置和行偏移量。这消除了标准 Parquet 文件中常见的昂贵、高延迟的扫描以及“依赖读取链”。通过优化文件布局(例如按键排序、交错列存储以及使用 ZSTD 帧重置),RAP 可以将查询简化为仅需几次千字节的并行范围读取,甚至可以通过覆盖索引完全免除存储读取。 最终,RAP 将数据湖从仅能进行批处理的系统,转变为能够提供交互式、实时 AI 上下文的系统,使企业能够以传统服务系统极低的分数成本和复杂度来查询历史数据。

Cursor 用户对最近的一项刻意更新表示强烈不满。该更新将所有自助服务方案(包括 Teams 版)的费用追踪从美元计费方式改为仅显示 Token(令牌)用量。此前,用户可以查看每次请求、每个模型以及每日的费用详情,这对他们的预算管理、监控模型效率以及了解支出至关重要。 Cursor 代表 "kevinn" 解释称,此举是旨在简化计费并避免用户混淆“套餐内包含用量”与“按需付费”的刻意设计。尽管用户仍可在仪表板中查看总支出,但移除精细到请求层级的成本数据(甚至包括历史记录和 API 端点中的数据)引发了强烈抵制。 用户认为,仅凭 Token 数量难以进行财务规划,且透明度的降低妨碍了他们评估不同模型的性价比。许多用户呼吁提供一个切换选项以恢复美元显示方式,认为此项更改降低了工具的实用性与透明度。批评者将此举描述为“开倒车”,要求 Cursor 要么恢复成本显示字段,要么提供更稳健、透明的支出追踪方式。

最近,Cursor 在其使用页面和 CSV 导出中移除了成本信息,这在 Hacker News 上引发了强烈抵制。用户认为,隐藏定价是一种具有敌意的“劣化(enshittification)”策略,旨在掩盖投资回报率并抑制用户对成本的关注。 除了定价争议之外,这场讨论还突显了“代理(agentic)”软件中的一个普遍趋势:不同编程框架在 Token 效率上存在巨大差异。用户指出,像 Claude Code 这样流行的工具往往会用过多的系统提示词和不必要的工具来“滥用”上下文窗口,导致成本激增。 工程师们正越来越多地尝试使用“极简主义”框架(例如 `smol`),这些框架依赖更精简的提示词和更少的注入工具。虽然这些轻量级代理可以显著减少 Token 消耗,但批评者警告称,它们可能会牺牲那些更复杂、“臃肿”的替代方案所具备的稳健性、编排能力和专业功能。 归根结底,这篇讨论反映出开发者日益增长的一种情绪:对 AI 辅助编程缺乏透明度感到沮丧,并转向那些能提供更强上下文管理和模型选择控制权的工具。这常常导致开发者放弃全能型 IDE,转而采用基于命令行的自定义工作流。

由于开发者兴趣转移,OpenBSD 的 `relayd(8)` 和 `httpd(8)` 的开发一度陷入停滞。作者出于对精通 C 语言的渴望,以及对“编程已被大语言模型解决”这一论调的挑战,主动承担起这些守护进程的现代化工作。 凭借实践经验和专业架构知识,作者对这些工具进行了系统性的重构。工作重点包括重构遗留的 `imsg` 代码、提升安全性、修复长期存在的错误以及增强功能。关键的安全更新包括:改用“安全”默认 TLS 密码套件、强化 HTTP 解析以防止请求走私,以及实施更严格的进程控制。 为了降低新贡献者的参与门槛,作者改进了文档,并打破了传统的仅限 CVS 的工作流,建立了易于访问的 Git 镜像(Gothub、Codeberg 和 GitHub)。这项振兴工作已经显著提升了这两个守护进程的稳定性和功能,未来还将有更多更新计划。通过拥抱 C 语言的复杂性并投身于规范的开源贡献,作者成功地焕新了这些此前面临停滞风险的关键基础设施。

受寻找琐事“最优解”(例如免费餐厅面包)的启发,一位软件工程师开始探寻“幂等键”(idempotency key)的起源,这是一种用于分布式系统中防止同一请求被重复处理的工具。 作者首先通过一个生动的类比阐述了这一概念:如何防止家里的狗林戈(Ringo)被不同的家庭成员重复喂食。在反驳了大型语言模型关于 Stripe 在 2011 年发明该概念的说法后,作者追溯了幂等性的演变过程,从 21 世纪初的“仅限一次 POST”(POST Once Exactly)规范和企业级传输协议,一直回溯到印加结绳记事等古老的记录方法。 将搜索范围聚焦于数字计算领域后,作者将这一谱系追溯到了施乐帕罗奥多研究中心(Xerox PARC)1984 年发表的研究论文《实现远程过程调用》(Implementing Remote Procedure Calls,作者为 Birrell 和 Nelson)。该论文描述了一种用于消除重复数据包的“调用标识符”,标志着该机制的一个基础实例。尽管作者承认要确定绝对的“首例”依然困难,但他们总结认为,对这类问题的探索凸显了人类是如何不断地重新发明解决方案,以应对分布式系统中“仅处理一次”这一持久难题的。

这篇 Hacker News 讨论探讨了在分布式系统中实现幂等性键的复杂性与哲学方法。 参与者争论了幂等性究竟应该通过“自然”领域建模(如使用基于业务逻辑的标识符或物理占用规则)来处理,还是通过 UUID、PUT 请求和数据库级 UPSERT 等通用技术中间件来处理。一些人认为,仅依赖中间件是一种“天真”的捷径,规避了对系统底层工作流的深入理解。 讨论的很大一部分集中在现代 API 缺乏标准化语义的问题上。开发者们表示,幂等性契约往往隐藏在冗长的文档中,而非定义在如 OpenAPI 这样机器可读的规范里,这令他们感到沮丧。这种不一致性——即某些服务商仅缓存成功响应,而另一些则存储错误——为重试逻辑和中间件的实现带来了风险。 最终,该讨论强调,尽管幂等性键对于防止分布式环境中的重复效应至关重要,但其实现方式依然支离破碎,这凸显了业界四十年来在实现端到端一致性可靠性方面所面临的挑战。(讨论中还穿插了一些关于餐厅免费面包质量的幽默插曲。)

``` CTRL 操作简单 单指操控。武器自动开火。易于上手,爱不释手。 SRC 开源 无黑箱。整个游戏在 GitHub 上开源,采用 GPLv3 协议。 OFF 离线畅玩 无需信号即可运行。整个游戏存储在您的手机中。 PRIV 无广告,无追踪 无需联网权限。不收集任何信息。数据绝不会离开您的手机。 PERM 无敏感权限 无需相机、麦克风、定位、通讯录、文件或网络权限。绝不索取任何权限。 FREE 永久免费 无价格,无应用内购买,无充值变强。完整游戏,完全免费。 ```

一场关于独立游戏《Astro Loop》(被描述为“《吸血鬼幸存者》风格的《太空大战》”)的 Hacker News 讨论,既展现了人们对该项目的热情,也反映出对人工智能生成内容日益增长的疲劳感。 支持者赞扬开发者发布了一款无广告、注重隐私且开源的项目,称其为“给人类的礼物”。该讨论帖也成为了其他人工智能辅助网页游戏(如《RoidBelt》和《Tankzone》)的展示平台。 然而,讨论很快转向了对该项目营销文案的批评。多名用户对落地页中“Claude 味”十足的语气表示不满,称其为缺乏个性的“企业心理咨询师式垃圾”。这引发了关于新兴“Claude 游戏”类型的更广泛讨论,人们质疑人工智能生成的营销便利性是否削弱了独立开源项目的真实性。尽管一些用户认为功能完善的免费软件不应因营销而受到评判,但另一些用户则对当前大语言模型生成文本中普遍存在的重复且过度诚恳的风格表达了日益强烈的反感。

更多

联系我们 contact @ memedata.com