每日HackerNews RSS

这篇文章以 **vLLM** 为核心案例,对现代高吞吐量大模型(LLM)推理系统进行了全面综述。文章采用倒金字塔结构,从基础引擎组件出发,逐步扩展至分布式生产环境。 **涵盖的关键概念包括:** * **引擎核心:** vLLM 的基础,通过连续批处理(Continuous Batching)和 **PagedAttention** 技术优化 KV 缓存内存管理,从而提升吞吐量。 * **高级功能:** 包括 **分块预填充(Chunked Prefill)**(用于处理长上下文)、**前缀缓存(Prefix Caching)**(复用已计算的 KV 块)、**引导解码(Guided Decoding)**(利用语法约束)以及 **投机解码(Speculative Decoding)**(使用小模型加速生成)。 * **扩展性:** 探讨 **MultiProcExecutor** 如何在多个 GPU 上实现张量并行和流水线并行,以及数据并行(DP)如何支持分布式多节点推理。 * **服务架构:** 分析通过 ZMQ 和 DP 协调器连接 API 服务器与引擎后端的异步负载均衡架构。 * **性能指标:** 探讨首字延迟(TTFT)和每输出 Token 延迟(TPOT)等指标定义的延迟与吞吐量权衡,以及如何利用屋顶线模型(Roofline Modeling)优化系统。 本系列文章提供了一份技术路线图,旨在解析最先进的推理引擎如何将复杂的硬件资源转化为简单、可扩展的 Web API。

这次 Hacker News 讨论聚焦于 2025 年对 vLLM(一款高吞吐量大语言模型推理引擎)的技术深度解析。尽管 vLLM 以“PagedAttention”闻名,但评论者强调,其真正的性能优势在于连续批处理、高效的 KV 缓存,以及 Web 进程与 GPU 进程之间稳健的架构分离。 对于那些希望在庞大复杂的代码库之外理解 vLLM 内部运作机制的人,社区推荐了两个教学资源: * **nano-vllm**:一个 5,000 行的 Python 实现,去除了抽象层,展示了引擎的核心机制。 * **tiny-vllm**:一个基于 C++/CUDA 的资源,因其出色的文档而备受赞誉,常用于学术环境。 该讨论帖还涉及了从零开始构建此类系统的实际挑战,指出即使有 AI 辅助编程,重构和“清理”生成的代码仍然是一个耗时的过程。开发者们正积极尝试这些架构,通过量化和专家模型交换技术,针对 Mac Mini 和消费级 GPU 等小型硬件进行性能优化。

作者指出了分布式系统中一个常见的架构陷阱,即“统一一致性”(Uniform Consistency)——即默认对整个系统应用单一一致性模型的错误做法。他们在构建集群消息代理时的亲身经历,因系统试图将整个集群的状态复制到每一个节点上,最终导致了内存溢出(OOM)危机。 团队意识到,错误的并非算法本身,而是他们最初提出的问题:“集群应该使用哪种一致性模型?”相反,正确的方法是“面向状态的一致性”(State-Oriented Consistency):即评估每一项状态,以确定其具体需求。 通过对状态进行分类——例如区分实时连接的所有权(需要协调者)和持久化消息存储(需要高持久性)——团队能够为每一类状态匹配满足其特定需求的最弱、最高效的机制。这种从全局一致性到特定状态保障的转变,简化了架构,降低了内存开销,并确保了每个组件仅执行其角色所必需的工作。核心启示在于:分布式系统架构应由各项状态固有的语义驱动,而非由“一刀切”的一致性要求所决定。

arXivLabs 是一个允许合作者直接在我们的网站上开发并分享 arXiv 新功能的框架。与 arXivLabs 合作的个人和组织都认同并接受我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv 始终致力于这些价值观,并仅与遵循这些价值观的合作伙伴开展合作。您是否有意开展一个能为 arXiv 社区增值的项目?了解更多关于 arXivLabs 的信息。

```Hacker News 最新 | 往期 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 通过剪枝和记忆化实现 miniKanren 的自底向上枚举 (arxiv.org) 由 Jimmc414 在 1 天前发布 | 24 点 | 隐藏 | 往期 | 收藏 | 1 条评论 | 帮助 ashton314 1 天前 [-] 喔,我喜欢任何与 miniKanren 相关的东西。我仔细研读了原始 miniKanren 论文中的实现;你可以在这里看到我的文章和实现:https://codeberg.org/ashton314/microKanren miniKanren 论文:http://webyrd.net/scheme-2013/papers/HemannMuKanren2013.pdf 同样相关——一个 miniKanren 的实际用例:https://aphyr.com/posts/354-unifying-the-technical-interview 回复 考虑申请 YC 2026 年秋季批次!申请截止日期为 7 月 27 日。 准则 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系方式 搜索: ```

请启用 JavaScript 和 Cookie 以继续。

在墨西哥格雷罗州偏远山区,瓜赫斯德阿亚拉(Guajes de Ayala)的居民组建了一支“自卫队”,以保护其土地免受“新米却肯家族”(Nueva Familia Michoacana)贩毒集团的侵害。面对非法采伐、强迫征募和绑架等系统性剥削,当地人拿起了武器——通常是利用从美国走私的军用级装备——来填补政府缺位留下的权力真空。 这一运动突显了该地区日益混乱的现实:众多分裂的贩毒集团、当地帮派和自卫组织如同“万花筒”般混杂,争夺着领土控制权。尽管墨西哥政府报告称全国凶杀案有所下降,但这些乡村聚居地的生活依然悲惨,呈现出鬼城遍布、学校废弃、诊所关闭的景象。 这一局势给总统克劳迪娅·辛鲍姆带来了复杂的挑战。她正面临着稳定国家的压力,人们担心贩毒集团首领“埃尔·门乔”(El Mencho)近期的死亡可能引发暴力权力真空。专家警告称,这些自卫组织往往被迫在危险的联盟中求生,面临被收编或摧毁的风险,这使社区陷入恐惧和孤立的循环中,当地居民在强大的犯罪势力面前,正艰难地维持着自身的自主权。

利用美国国家科学基金会(NSF)丹尼尔·井上太阳望远镜(Daniel K. Inouye Solar Telescope)的研究人员在太阳表面发现了开尔文-亥姆霍兹不稳定性(KHI)——即微小的漩涡状结构。这项发表在《自然》杂志上的突破性研究证实了一个长期以来的理论猜想,该现象此前因尺度过小而无法观测。 通过对比高分辨率图像与计算机模拟,研究团队在磁场区域的边界处识别出了这些漩涡。这些漩涡之所以重要,是因为它们可能充当了太阳活动的“引擎”。KHI 很可能触发了磁场的“编织”和重联,从而为太阳耀斑和日冕物质抛射提供能量,这些活动可能会干扰地球的卫星和电网。 此外,这一发现填补了关于太阳的两大未解之谜:太阳外层大气如何维持极高温度,以及磁场为何消散得如此之快。通过揭示这些漩涡如何混合磁化与非磁化等离子体,研究结果提高了我们对太空天气进行建模和预测的能力。这项研究凸显了井上太阳望远镜在观测驱动太阳剧烈爆发的精细动力学方面的强大能力,标志着我们对恒星物理学的理解取得了重大进展。

使用国家科学基金会丹尼尔·井上太阳望远镜(DKIST)的科学家们已成功观测到太阳表面的开尔文-亥姆霍兹不稳定性。这种现象发生在流体层以不同速度移动时,长期以来被认为是理解太阳能量耗散、太阳黑子形成及太阳耀斑的关键因素。 此前,太阳物理学研究受限于现有望远镜的分辨率以及进行精确磁流体动力学(MHD)模拟所需的计算能力。DKIST的4米孔径使空间分辨率比以往仪器提高了五倍,研究人员得以首次详细观测到这些充满能量传输的湍流涡旋。 除了加深我们对太阳动力学的理解外,这一突破对地球物理学(特别是核聚变研究)也具有实际意义。对这些不稳定性的改进建模,有助于优化等离子体边缘控制、提高热保留率,并改善反应堆设计中的聚变增益。这些发现使太阳物理学从一个主要的定性领域转向更加精确的定量领域,标志着我们在研究和模拟太阳复杂能量过程的能力上达到了一个重要的里程碑。

AMD 已收购 AI 芯片初创公司 Taalas。该公司通过将模型权重直接刻入硅片,彻底改变了推理过程。与依赖高带宽内存(HBM)存储权重的传统 GPU 不同,Taalas 的“模型专用集成电路”(MSIC)有望将推理速度提高一个数量级,同时显著提升能效和空间利用率。 Taalas 的架构利用“掩模 ROM 召回结构”永久存储模型权重,使单个加速器有望处理 200 亿个参数。尽管这种方法速度极快,但也存在折衷:模型一旦刻入,更新时需要进行昂贵且耗时的芯片重新设计(re-spin),不过 Taalas 声称仅更新两层金属层即可缓解这一问题。 AMD 计划将 Taalas 的技术整合到其现有的数据中心生态系统中,很可能采用一种混合模式:由 GPU 处理计算密集型的提示词处理,而由 Taalas 加速器负责快速的标记生成。此次收购标志着 AMD 的战略转型,旨在通过为高需求 AI 智能体提供高度优化且专业的硬件,来挑战 Nvidia 的主导地位。该交易预计于第四季度完成,可能会重塑企业部署和运行大规模 AI 模型的方式。

AMD 已收购初创公司 Taalas,该公司专注于将大语言模型(LLM)权重直接刻蚀在芯片上的“存内计算”(compute-in-memory)技术。通过摒弃传统的冯·诺依曼架构,Taalas 的芯片提供了前所未有的推理速度——演示显示,Llama 3.1 8B 模型运行速度接近每秒 17,000 个 token。 HN(Hacker News)用户围绕这种“模型芯片化”方案的可行性展开了讨论: * **速度的优势:** 支持者认为,超大规模的吞吐量(每秒 1000+ token)能够实现全新的工作流,例如多智能体推理、“边打字边搜索”式智能以及实时交互任务。这有望显著降低边缘计算和机器人的应用门槛。 * **过时的争议:** 批评者指出,专用集成电路(ASIC)设计成本高昂且灵活性不足。由于模型是硬编码的,随着人工智能领域的快速演进,这些芯片面临着迅速过时的风险。有人建议,该技术更适合稳定的特定领域任务,而非追逐最前沿的尖端模型。 * **商业潜力:** 有观点猜测,这可能会开辟一个“AI 卡带”或可插拔硬件模块的新市场,使用户能够像更换显卡一样轻松更换模型。虽然前沿实验室可能更倾向于灵活的云基础设施,但工业和消费级应用可以从低功耗、性能“足够好”的内置智能中获益。

AMD 已宣布达成最终协议,收购总部位于多伦多的初创公司 Taalas。该公司专注于定制化 AI 推理芯片。Taalas 成立于 2023 年,致力于优化数据流,以克服通用硬件中固有的计算和内存瓶颈。 通过将 Taalas 的专业技术整合到其现有的 AI 产品组合(包括 AMD Instinct GPU、EPYC CPU 和 ROCm 软件栈)中,AMD 旨在显著提升其推理性能和效率。此举旨在加强 AMD 的全栈 AI 路线图,使公司能够为快速增长的 AI 市场提供高度优化的系统级解决方案。 此次收购加强了 AMD 对其加拿大业务及人才储备的投入。该交易尚需满足惯例成交条件并获得监管部门批准。通过此次合作,AMD 旨在为客户提供更大的灵活性,以在更广泛的应用场景中部署高效、高性能的 AI 工作负载。

抱歉。

SpaceX 旗下的 xAI 因在孟菲斯快速且备受争议地建设其“巨像”(Colossus)数据中心而面临强烈批评。批评者和当地居民认为,该公司通过安装未经许可的燃气轮机,绕过了环境法规和公众监督,向一个以黑人为主的社区排放了包括甲醛在内的有毒污染物。 尽管南方环境法律中心曾就这些违反《清洁空气法》的行为提起诉讼,但联邦政府以国防部人工智能发展相关的“国家安全”需求为由,干预并驳回了该诉讼。此后,xAI 已达成协议,承诺在 2027 年 7 月前用永久性发电厂取代这些“临时”涡轮机,但居民们仍对缺乏问责机制、持续的环境恶化以及化学和噪音污染带来的健康影响表示担忧。 该项目凸显了硅谷“快速行动,打破常规”的理念——即在追求人工智能增长的过程中,企业利益被置于边缘化群体的健康之上。批评者指出,xAI 以技术进步为名,持续掩盖其计划并逃避责任,实际上使自身豁免于其他开发项目必须遵守的法律和环境标准。

这段关于 Hacker News 的讨论围绕一篇文章展开,该文详细叙述了被马斯克旗下公司 SpaceX 收购的 xAI 如何在孟菲斯的一处数据中心违规运营污染环境的燃气轮机。核心争论集中在以下两个方面: 1. **企业违法行为**:批评者认为,数据中心为加快建设进度,经常绕过当地的环境和分区法规。他们主张当前的经济处罚力度不足,因为企业将罚款视为营运成本。建议的替代方案包括更严厉的惩罚措施,如勒令设施停运多年,或追究企业高管的刑事责任。 2. **监管的角色**:项目的辩护方认为,电网基础设施建设缓慢,迫使企业进入“灰色地带”以维持竞争力。其他人则认为该文章存在偏见,批评其引入了煽动性细节(如指控该 AI 参与生成非自愿图像),认为这分散了人们对环境合规性这一具体法律问题的关注。 参与者对所谓“白领犯罪”缺乏问责机制表示强烈不满,并指出法律诉讼往往会被联邦政府以国家安全利益为由拖延或驳回,导致当地社区几乎投诉无门。

为庆祝《雷神之锤》(Quake)诞生 30 周年,id Software 与 MachineGames 发布了名为《机械黎明》(Dawn of the Machine)的免费更新,现有的《雷神之锤》玩家现已可直接获取。 这部内容丰富的全新篇章包含 19 张全新地图、一个专用主界面、全新的原声带以及一张新的死亡竞赛地图。玩家将进入一个扭曲现实的循环战役,必须摧毁“噩梦机器”以逃离无尽的暴力轮回。此次更新引入了独特的玩法机制,如永久进度升级和空间位移,同时还增加了诸如“血之蹒跚者”(Blood Shambler)等致命的新型敌人,以及激光炮等强力武器。 此外,本次更新还包含了一系列体验优化,包括降低输入延迟和增强手柄支持。《机械黎明》现已登陆 Xbox、PlayStation、Nintendo Switch 和 PC(Steam/Game Pass/Microsoft Store)平台。请注意,目前 Epic Games Store 和 GOG 平台暂不支持此内容。玩家启动游戏后,即可自动获取该更新。

为庆祝《雷神之锤》(Quake)诞生 30 周年,Bethesda 发布了全新扩展包“机器黎明”(Dawn of the Machine)。这一消息在 Hacker News 上引发了充满怀旧色彩的热烈讨论,人们纷纷回顾了该游戏深远的文化影响。 资深玩家们重温了那个属于局域网联机派对、CRT 显示器以及早期 3D 游戏带来无限快感的时代。技术讨论则聚焦于该游戏引擎最初的卓越设计——特别是它如何依赖英特尔奔腾处理器才能流畅运行——以及社区对模组制作长久以来的热爱。 尽管许多人称赞了新内容的质量,但也有人对现代游戏趋势表达了失望,例如社区自建服务器的减少、现代射击游戏中作弊泛滥,以及 90 年代那种“亲密”在线社区的消逝。一些用户批评了该系列的企业管理方式,指出在庆祝《雷神之锤》辉煌遗产的同时,其原始工作室 id Software 却面临着重大的人事变动和裁员,这显得颇具讽刺意味。 尽管人们对现代企业的支持持怀疑态度,但普遍共识依然认为,《雷神之锤》是一部经久不衰的经典,其体验在许多方面仍优于现代游戏。对于追求终极《雷神之锤》体验的玩家,大家强烈推荐诸如《Arcane Dimensions》等社区主导的项目。

更多

联系我们 contact @ memedata.com