今天,我们迎来第 47 个加入 Have I Been Pwned 免费政府服务项目的政府:尼泊尔。其国家网络安全中心(NCSC)现已能够监测尼泊尔政府域名在 HIBP 中的数据情况。这使 NCSC 有能力识别政府邮箱地址的泄露情况,并在这些账户出现在新的数据泄露事件时迅速做出响应。 这正是 HIBP 政府服务的初衷:通过提供政府域空间内受损凭据和泄露账户的可见性,帮助国家级网络安全团队加强威胁监测和事件响应能力。 尼泊尔加入了一个不断壮大的政府与国家网络安全团队列表,他们正在利用 HIBP 来更好地了解自身的风险敞口,保护政府部门和公共资源,并在攻击者利用这些漏洞之前降低受损凭据带来的风险。
这篇文章以 **vLLM** 为核心案例,对现代高吞吐量大模型(LLM)推理系统进行了全面综述。文章采用倒金字塔结构,从基础引擎组件出发,逐步扩展至分布式生产环境。
**涵盖的关键概念包括:**
* **引擎核心:** vLLM 的基础,通过连续批处理(Continuous Batching)和 **PagedAttention** 技术优化 KV 缓存内存管理,从而提升吞吐量。
* **高级功能:** 包括 **分块预填充(Chunked Prefill)**(用于处理长上下文)、**前缀缓存(Prefix Caching)**(复用已计算的 KV 块)、**引导解码(Guided Decoding)**(利用语法约束)以及 **投机解码(Speculative Decoding)**(使用小模型加速生成)。
* **扩展性:** 探讨 **MultiProcExecutor** 如何在多个 GPU 上实现张量并行和流水线并行,以及数据并行(DP)如何支持分布式多节点推理。
* **服务架构:** 分析通过 ZMQ 和 DP 协调器连接 API 服务器与引擎后端的异步负载均衡架构。
* **性能指标:** 探讨首字延迟(TTFT)和每输出 Token 延迟(TPOT)等指标定义的延迟与吞吐量权衡,以及如何利用屋顶线模型(Roofline Modeling)优化系统。
本系列文章提供了一份技术路线图,旨在解析最先进的推理引擎如何将复杂的硬件资源转化为简单、可扩展的 Web API。
AMD 已宣布达成最终协议,收购总部位于多伦多的初创公司 Taalas。该公司专注于定制化 AI 推理芯片。Taalas 成立于 2023 年,致力于优化数据流,以克服通用硬件中固有的计算和内存瓶颈。
通过将 Taalas 的专业技术整合到其现有的 AI 产品组合(包括 AMD Instinct GPU、EPYC CPU 和 ROCm 软件栈)中,AMD 旨在显著提升其推理性能和效率。此举旨在加强 AMD 的全栈 AI 路线图,使公司能够为快速增长的 AI 市场提供高度优化的系统级解决方案。
此次收购加强了 AMD 对其加拿大业务及人才储备的投入。该交易尚需满足惯例成交条件并获得监管部门批准。通过此次合作,AMD 旨在为客户提供更大的灵活性,以在更广泛的应用场景中部署高效、高性能的 AI 工作负载。