每日HackerNews RSS

这篇文章追溯了“唯一凭直觉就能使用的界面就是乳头”这一说法的来源。人们通常认为这句话出自布鲁斯·埃迪格,但他否认是自己发明的。早在1994年8月,斯科特·弗朗西斯就在一篇帖子中提出了这一概念。1995年1月,杰·沃尔默也给出了几乎相同的表述:“实际上,唯一真正凭直觉就能使用的界面就是乳头。”从1995年2月起,埃迪格开始使用类似说法,其中包括:“除此之外,一切都得靠学习。”他究竟是沿用了沃尔默的措辞,还是从其他地方看到了这个想法,目前并不清楚。作者认为,埃迪格最有资格被视为人们熟悉的那种说法的来源,但作者更喜欢他后来更为讽刺的版本:“根本不存在凭直觉就能使用的界面,连乳头也不例外。一切都得靠学习。”

一场 Hacker News 讨论质疑了“唯一符合直觉的界面是乳头”这一说法。许多父母和哺乳专家指出,母乳喂养并非天然容易:婴儿可能难以正确含乳,母亲也可能出现奶水不足、感染、疼痛或其他需要专业帮助的医疗问题。 其他人则强调,直觉是相对的,并非绝对。人们会通过经验熟悉各种模式,因此,一个设计对某位用户来说可能很直观,对另一个人却可能令人困惑。评论者还区分了反射、本能和后天习得的行为,并指出,即使是成功触发的反射,也需要有利条件。 一些关于动物无法哺乳或保护幼崽的 anecdotes,进一步说明进化并不保证繁殖毫无障碍,也不保证父母一定称职。关于 ThinkPad 小红点、人体解剖和性繁殖的玩笑让讨论轻松了一些,但总体结论是:那句话虽然很吸引人,却过于简化——世上没有任何事物是 universally intuitive,而“直观”也不一定意味着容易或可靠。

该基准比较了九种用于提示词注入防护和内容安全的 AI 护栏方案,涵盖小型预训练分类器、零样本分类器、Jev 式决策模型以及 LLM 评审系统。 预训练分类器仍具有很强的竞争力:DeBERTa 在提示词注入检测上的准确率达到 89.01%,中位延迟为 54 毫秒;Granite Guardian 在内容安全方面的准确率达到 80.27%,延迟为 33 毫秒。Qwen3.6-35B 以 89.31% 的准确率取得提示词注入检测最高成绩,而 Jev 以 86.20% 的准确率略微领先内容安全检测。 较新的决策模型也具有竞争力,但在速度、成本和准确率方面并不总是优于传统分类器或 LLM 评审系统。BART-large-mnli 的表现较差,因为其有限的标签无法表达细致的策略要求。Shieldstral 的表现也低于预期,并且对提示词措辞非常敏感。Laya 经过策略调优后,准确率从 57.87% 提升至 75.20%;然而,同一策略却降低了 Jev 的准确率,表明决策模型的提示词具有高度模型特异性。 总体而言,在缺少合适标注数据的情况下,决策模型提供了一种灵活、可复用且由模式驱动的替代方案;但如果有专门的轻量级分类器可用,它们仍是最佳选择。模型选型应依据具体任务的准确率、延迟、基础设施和调优需求,而不应取决于对某种架构的偏爱。

一场 Hacker News 上的讨论围绕 Jev 式决策模型是否优于基于大语言模型的评判器和传统分类器展开。评论者认为,现有基准过于简单,尤其难以评估多步骤推理能力;而 Jev 的开发者声称,在更复杂的任务上,Jev 在准确率、校准效果、速度和成本方面都优于 Luna、GLiDE 等模型。 更广泛来看,需要权衡通用性、准确性和运营成本。传统分类器仍非常适合垃圾邮件检测这类定义明确且处理量大的任务;大语言模型灵活性更高,但相对更慢、成本更高;决策模型则可能为新颖的分类问题提供一种有用的折中方案。其他评论者强调,智能体系统不仅需要出色的基准准确率,还需要可靠的置信度估计、有信息量的预测,以及对分布变化的鲁棒性。

本文介绍了一套以 Emacs 和 Org-mode 为核心的静态站点发布流水线。Org 文件是唯一的事实来源,支持可执行源代码块、BibLaTeX 引用和可复现的 d2 图表。该方案不要求站点生成器直接解析 Org,而是由 Gleam 程序调用 Pandoc,将文章转换为 GitHub 风格的 Markdown,并使用小型 Lua 过滤器处理诗歌、参考文献和图片路径。 随后,Gleam、Blogatto 和 Lustre 将 Markdown 转换为经过类型检查的 HTML、RSS 和静态资源。Nix flakes 与 devenv 用于锁定依赖并提供可复现的开发环境;`make run` 和 `make dev` 负责完成整个构建过程。 尽管对于一个简单站点来说,这套技术栈似乎显得过于庞大,但每个工具都承担着明确而专注的角色。作者将这种“有益的臃肿”视为一种连贯的替代方案,可以省去在多个专用编辑器和应用之间切换的麻烦。整套系统的核心仍然是 Emacs:Org-mode 在一个交互式环境中整合了文章写作、代码、计算、结构组织、引用、图表和发布等功能,提供了纯 Markdown 难以自然复现的能力。

一场关于自定义博客发布流程的讨论引发 了争论。这套流程结合了 Gleam、Org-mode、Pandoc、Emacs Lisp 和 Nix,但人们质疑如此高的复杂度是否合理。作者将其视为一项实验,并认为它能提供语法高亮和 RSS 等实用功能。评论者则指出,Org-mode 只需很少的代码就能发布 HTML,而 Markdown 配合 Pandoc 可能更加简单。WordPress 和 Ghost 也被推荐为无需维护的替代方案,但它们在安全性和编辑器功能方面的不足遭到了批评。 Emacs 用户强调,Org-mode 能保留他们熟悉的工具和操作习惯,让作者专注于写作。用户对 Org 与 Markdown 的比较同样存在分歧:Org 提供了更丰富的组织能力和 Emacs 集成,但有时显得笨重、依赖 Emacs,而且不太适合某些博客内容;Markdown 则更简单,也更具可移植性。 总体而言,共识是:最好的博客技术栈,就是那个能帮助作者持续写下去的方案,即使它看起来复杂得有些“拜占庭式”。

作者评估了 TypeSafe 的 Jev:这是一个低成本“System One”分类器,通过在预训练 Transformer 上附加一个决策头来构建。与自回归大语言模型不同,Jev 会返回带有各选项概率的有类型多选题结果。 在涵盖十种概率分布的一千个基于物理的场景中,Jev 往往能够识别出正确的分布,但其概率校准很差。它的平均总变差误差为 0.518,仅略优于均匀猜测的 0.546。它通常表现得过于尖锐,难以处理逐渐趋近于零的尾部,会给不可能的区间分配概率,并且可能直接利用提示词中明确给出的答案。在公平硬币和骰子问题上,它同样表现得过度自信且存在偏差。 Jev 能够处理相当 advanced 的孤立计算,包括平方根,但会拒绝回答多步骤算术题,并且在追踪十的幂方面尤其困难;单位换算似乎并不是主要问题。作者认为,部分原因在于模型缺少思维链或外部中间存储机制。 这篇文章还警告称,前沿模型可以设计出看似合理的实验,却遗漏致命的实现缺陷——其中一些提示词意外包含了答案,从而把概率校准测试变成了答案抄写测试。

该讨论涉及 **Jev**——一个基于语言模型的小型快速分类器,用于为可能的答案输出概率。一项基准测试发现,在具有已知概率分布的问题上,例如麦克斯韦–玻尔兹曼速度分布或公平骰子,Jev 输出的分数看似合理,却并非准确概率,因此人们质疑其概率校准能力。 支持者认为,这些测试超出了 Jev 的预期适用范围。它针对的是自然语言分类而优化,并不适用于数学推理、连续数值输出或物理约束的 enforcement。他们指出,Jev 在常规自然语言处理任务上的初步测试表明,其校准表现尚可;而且,它的速度优势来自使用了非常小的模型。 另一些人则坚持认为,即使是简单的概率问题也属于有效测试,而 Jev 的核心价值主张就是提供可信的概率。如果这些输出还需要大量事后校准,那么这一主张就会被削弱。一位评论者报告称,校准将 Jev 在 TRIVIA+ 上的期望校准误差从 0.0982 降至 0.0313,同时没有明显改变 F1 分数,使置信度得分更适合用于任务路由和升级处理。 尚未解决的问题是:Jev 能否进行全局校准,还是只能在特定任务和领域内进行校准。

作者结合家庭谈话、中国媒体和个人经历,认为面向中国的理性主义与人工智能安全宣传,可能需要考虑几种文化倾向。这些倾向包括:对社会认可、羞耻和“面子”的强调;网络上的受众反应十分显眼,以及由梗图主导的注意力经济;普遍存在一种类似“暗黑世界”思维的犬儒心理,人们可能更看重力量与不信任,而非善意;民族主义则部分受到历史不安全感以及渴望获得国际认同的影响。 作者还指出,人们对食物新鲜度较为谨慎,却更能容忍人工制作或质量较差的数字媒体,因此,AI生成内容或许契合当地已有的媒体习惯。不过,作者明确说明,这些观察均来自个人经历,受到代际和移民背景的影响,并不代表所有中国人。 对于推动国际人工智能暂停倡议,核心建议是根据当地规范调整信息表达,避免道德说教或“自以为高尚”的姿态,同时在竞争激烈、极为残酷的媒体环境中争夺注意力。

Hacker News 上的一篇讨论帖围绕这样一篇文章展开:文章认为,中国社会受到物资匮乏、激烈竞争、社会压力与“面子”、历史创伤、民族主义、国家控制的媒体以及社会信任度低等因素的塑造。作者是一名在美国长大的美籍华人,并承认自己主要依靠家人和中国媒体了解中国,而没有丰富的第一手经验。 许多评论者认为,快速发展、饥荒记忆、文化大革命、高考与户口制度带来的压力、对子女孝顺的期待,以及残酷的市场竞争,都可以解释这些现象。另一些人则认为,这篇文章把一个庞大且高度多元的群体刻板化,忽略了地区、阶层、代际和城乡差异,并用意图解释系统或政治因素的方式,取代了对固定民族性格的概括。 一些人还反驳了“同情心是一种奢侈品”的说法,并列举了中国境内外的贫困社区中普遍存在的善意行为。评论者还将这些现象与美国及其他地方由匮乏驱动的行为、社会羞辱、政治极化和不信任进行了比较。 讨论者指出,年轻中国人往往会拒绝文章所描述的那种“黑暗世界”心态。如今,人工智能翻译也让普通中国民众能够直接向外国受众分享自己的经历。版主多次呼吁大家进行具体、尊重他人的讨论,并批评笼统或充满敌意的回复。

本月目标是让全部 20 亿个 token 都使用 GLM 5.3 Flash,但实际只有 50% 的使用量使用了目标模型。前半段保持在预算内,花费 68 美元,耗电约 4 千瓦时,排放 365 克二氧化碳;由于基础设施容量问题以及大量模型实验,剩余 10 亿个 token 转而使用了其他模型。 最大的一项意外支出是一个快速编码完成的 Wagtail MCP 原型。由于选错了模型,它在一夜之间消耗了 4.5 亿个 token、花费 150 美元,并耗电 5 千瓦时。虽然这个原型做出了有价值的演示,但如果规划得当,类似结果很可能只需约五分之一的成本即可实现。 总体而言,实际耗电量为 35 千瓦时,而目标是 10 千瓦时,因此这次挑战在技术上并不成功,但提供了很多有价值的信息。后续措施包括:持续在本地测量成本、能耗和结果;设定明确的实验预算;更加谨慎地选择原型和模型;采用有明确范围和限制的多智能体工作流;以及持续评估高效的模型。目标是让大多数常规 AI 推理使用一个或两个低成本的 Flash 模型,并以效率和结果为评估标准,而不是只看 token 数量。

一场 Hacker News 讨论围绕一项为期一个月的实验展开,实验者使用 GLM 5.3 Flash 进行智能体编程。总共花费约 68 美元;按照 Neuralwatt 仅计算 GPU 耗电量的估算,共消耗 4 千瓦时。结论是,该模型适合日常开发,但有时速度较慢,不太适合需求含糊或偏高层面的工作。一次意外持续到夜间的任务使用了价格高得多的非 Flash 模型,消耗了 4.5 亿个 token、花费 150 美元,并耗电约 5 千瓦时。这带来了有关模型选择、用量监控、限制智能体任务范围和预算控制的教训。 许多 commenters 认为 Flash 能力不错、价格低廉,可以作为主力模型,通常还会搭配一个更强大的规划或审查模型使用。不过,与 DeepSeek、Qwen 和其他开放模型的比较结果则好坏不一。 最大的争论集中在人工智能基础设施上。一些人认为,单次推理的能耗并不高,云端批处理的效率也很高,而数据中心建设计划可能又是一轮类似光纤网络的过度建设。另一些人则强调本地环境影响、训练和基础设施成本、杰文斯悖论带来的需求增长,以及供应限制。Neuralwatt 的能耗计算方法和价格估算也受到质疑,但作者为其透明度进行了辩护,并表示这些估算与其他估算基本一致。

``` 请启用 JavaScript 并禁用任何广告拦截器 ```

Hacker News 的用户既兴奋又难以置信地得知,前匹兹堡钢人队教练迈克·汤姆林花了大约 12 年时间,在《我的世界》中建造了一座规模庞大、细节丰富的城市。他主要使用手柄在创造模式中操作,亲自逐块放置方块,并将建筑、景观设计和城市规划等方面的理念融入其中。这个项目最初是他与孩子们一起开始的,后来成为他在承受执教压力时私下排遣和疗愈的出口,直到孩子们说服他公开展示。 讨论强调,手工制作的过程以及与家人的联系比最终成品更重要。这也引发了一场争论:人工智能或许能更快地重建这座城市,却无法重现它背后个人化的经历。评论者还挑战了“运动员不聪明或没有创造性爱好”这类刻板印象,并指出,即使是要求严格的教练,也能保有有意义的休闲时间。 讨论串后来还延伸到了汤姆林担任钢人队教练的 19 年任期、四分卫更替、季后赛表现,以及故意输球是否合乎道德等问题。后续另一场关于人工智能和全民基本收入的讨论涉及了自动化、基本收入、人生目标、社会责任,以及社会是否应该重视艺术和休闲。一些带有讽刺意味或不屑一顾的评论被标记为低质量内容。

今天,我们与 Planet 合作打造的 Project Suncatcher 原型卫星,已搭载 SpaceX 的 Transporter-18 拼车共享任务进入轨道。团队已确认与卫星建立联系,卫星运行正常。 这是长期研究计划迈出的第一步,我们将探索未来是否有可能在太空中部署可扩展的机器学习基础设施。未来几周,我们将收集在轨数据,了解我们的 TPU 如何应对太空飞行带来的物理应力,以及太空中的极端辐射和温度环境。 相关研究的同行评审论文现已发表于《Joule》。 有些事情只有在太空中才能进行测试。随着实验逐步展开,我们将利用所得结果优化设计,并很高兴在任务推进过程中分享更多进展。

谷歌的“追日者计划”已将一颗原型卫星送入轨道,用于测试在太空中利用 TPU 芯片进行计算。讨论普遍对其 envisioned 的规模持怀疑态度:未来一座配备10万块芯片的计算设施可能需要约370兆瓦电力、巨大的太阳能板和散热器,并需进行数千次发射。 主要担忧包括当前高昂的发射成本、辐射与热管理问题、卫星进入地球阴影时无法获得太阳能、GPU快速过时、硬件故障、无法在轨维护、额外延迟,以及大型轨道星座对夜空视觉造成的影响。评论者还质疑,与地面数据中心相比,尤其是在能够以更低成本利用可再生能源或核能的情况下,地面计算设施是否仍更具经济性。 支持者认为,跟随晨昏线运行的太阳同步轨道可以提供接近连续的日照,而可重复使用的星舰最终可能使轨道计算具备竞争力。用于推理、卫星图像处理、抗灾害能力或军事应用的小型计算集群,可能比大型人工智能训练设施更早实现商业可行性。还有人认为,该项目也可能是为应对地面设施许可阻力而采取的游说或公共关系策略。原型卫星的实际性能数据被视为接下来的关键考验。

关于 新闻 版权 联系我们 创作者 广告服务 开发者 条款 隐私 政策与安全 YouTube 的运作方式 测试新功能 © 2026 Google LLC

《The Hacker News》的讨论围绕 Greg Kroah-Hartman 对 Anthropic 的 Mythos 的批评展开。Mythos 声称发现了 79 个 Linux 漏洞,但对相关报告的复核发现,其中许多漏洞是捏造的、已经修复的、并非真正的漏洞,或是确实存在但影响较小且容易修补的问题。评论者普遍认为,这说明前沿实验室的安全营销存在夸大之处,并未充分考虑验证成本、漏洞在现实环境中的严重程度,以及内核维护人员日常面对的大量常规工作。 不过,讨论也认为,LLM 辅助发现漏洞仍然很有价值,尤其是在审查较少或专有闭源项目中。模型能够识别漏洞模式,工作速度也比人类更快,但它们往往会以笃定的语气给出冗长的错误发现,仍需专家审核。几位评论者将它们比作积极主动但经验不足的实习生,也有人强调,不应像评价人一样评价这些工具,毕竟它们不会学习,也不会承担责任。 practical advice? “实用的建议包括:独立验证相关声明,不要轻信生成的解释,使用专门的工具和测试框架,并在本地运行开放权重模型,以保护机密代码。有人担心 AI 会缩短漏洞利用的开发时间,或帮助构建恶意自主智能体,但 generally considered speculative rather than demonstrated by Mythos Linux results.” Need “specialized tools and harnesses” specialized tools and test harnesses. “恶意自主智能体”. Good. Need no extra.《The Hacker News》的讨论围绕 Greg Kroah-Hartman 对 Anthropic 的 Mythos 的批评展开。Mythos 声称发现了 79 个 Linux 漏洞,但对相关报告的复核发现,其中许多漏洞是捏造的、已经修复的、并非真正的漏洞,或虽然真实存在但影响较小且容易修补。评论者普遍认为,这表明前沿实验室的安全营销存在夸大之处,并未充分考虑验证成本、漏洞在现实环境中的严重程度,以及内核维护人员日常面对的大量常规工作。 不过,讨论也认为,LLM 辅助发现漏洞仍然很有价值,尤其是在审查较少或专有闭源项目中。模型能够识别漏洞模式,工作速度也比人类更快,但它们经常以笃定的语气给出冗长的错误发现,仍需专家审核。几位评论者将它们比作积极主动但经验不足的实习生,也有人强调,不应像评价人一样评价这些工具,毕竟它们不会学习,也不会承担责任。 实用的建议包括:独立验证相关声明,不要轻信生成的解释,使用专门的工具和测试框架,并在本地运行开放权重模型,以保护机密代码。有人担心 AI 会缩短漏洞利用的开发时间,或帮助构建恶意自主智能体,但这些问题通常被认为只是推测,并没有得到 Mythos 的 Linux 漏洞研究结果证实。

Paul Byrne(theplanetaryguy.com)发布: plc:wwbktud2d34ont3frkv73pjo 这永远会让我感到震撼。这是一颗距离我们133光年的恒星,连续12年的真实望远镜图像记录。还有四颗行星在它周围缓慢运行。四颗真实的系外行星,每颗的质量都超过木星,并且随着它们绕宿主恒星运行而被拍摄下来。 2026-10-02T02:14:08.162Z

一则 Hacker News 讨论帖介绍了一个对 HR 8799 系统的可视化项目:它将大约 12 年的观测数据压缩到短短几秒内,呈现四颗巨型系外行星围绕恒星运行的样子。评论者赞叹其视觉效果,同时强调这并不是连续的现场影像:现实中只有大约十张图像,而且彼此相隔数年;多数画面都是利用基于开普勒定律的运动插值生成的。其中一些闪烁特征被认定为衍射、镜像相位差异或插值伪影,而非真实的天文现象。 讨论还说明,每张图像都需要多个夜晚和大量望远镜观测时间,而观测只能安排在合适的季节窗口内。帖子也展望了罗曼空间望远镜和宜居世界天文台等未来的直接成像天文台,并探讨了建造分布式空间望远镜所面临的技术挑战。 更广泛的延伸讨论涉及对德雷克公式的怀疑、恒星环绕人马座 A* 运行的动画、科学图像的情感与教育价值、科学传播中的透明度,以及如何为后代保存天文数据和媒体资料等难题。

更多

联系我们 contact @ memedata.com