这项研究针对 AMD Zen 3 架构的单核心,对单精度(FP32)矩阵乘法(GEMM)进行了系统性优化。通过在 C++ 中使用 AVX2/FMA 内置函数,测试了 28 种技术变体,包括缓存分块(cache blocking)、寄存器分块(register blocking)、FMA 指令链(chaining)以及封装(packing)策略。 性能最佳的模型 **MX24** 达到了 **85.30 GFLOPS**(占 134.4 GFLOPS 理论峰值的 63.5%),比原始实现快 56.5 倍,并与 OpenBLAS 和 AMD AOCL 等知名库的测试结果相当。 **主要结论:** * **最佳实践:** 采用 4 行寄存器分块、4 个累加器链式计算以及即时(on-the-fly)B 矩阵封装,是最大化 FMA 端口利用率并减少内存瓶颈的理想组合。 * **陷阱:** 由于 Zen 3 硬件预取效率较高,软件预取(software prefetching)等技术反而适得其反;而使用非时序存储(non-temporal stores)则因在读-改-写操作中导致缓存失效,从而大幅降低了性能。 该存储库提供了完整的源代码、模型详细分析及复现支持,可作为现代 x86 架构性能优化的技术参考。
ActPlane 论文探讨了 AI 编程助手接收的自然语言指令与操作系统层面可执行规则之间的“执行鸿沟”。尽管开发者会在 `CLAUDE.md` 等文件中编写详尽的指南,但大多数系统因缺乏上下文(如项目结构、时序逻辑),无法将模糊的要求转化为机器可评估的具体检查,从而导致这些指南难以被落实。
该研究分析了 64 个热门代码仓库中的 2,116 条指令,结果显示,83% 的策略属于“系统可观测”范畴,但仅有 45% 可以通过操作系统钩子直接强制执行。许多规则涉及跨事件逻辑,例如“提交前必须运行测试”,这需要追踪操作过程中的状态、顺序和血缘关系。
ActPlane 通过将自然语言策略编译为基于 eBPF 的执行引擎来弥合这一鸿沟。该系统利用时间门控和信息流标记在内核级强制执行规则,并在违规时向代理提供语义反馈。这种反馈至关重要:它使代理能够理解操作被拦截的原因并成功调整策略,从而在违规时的恢复率达到 97.7%。与传统的工具级或基于提示词的过滤器相比,ActPlane 能够捕获隐藏在子进程或中性入口点之后的操作,且性能损耗极低,显著提升了合规性。
一位联邦法官裁定,前联邦紧急事务管理局(FEMA)首席财务官玛丽·科曼斯(Mary Comans)有权举行听证会以澄清名誉。科曼斯于2025年2月被特朗普政府解雇,此前国土安全部和埃隆·马斯克领导的政府效率部(DOGE)指控其滥用5900万美元的FEMA资金,用于纽约市豪华酒店的移民安置。
地区法官迈克尔·纳赫曼诺夫(Michael Nachmanoff)要求双方就听证流程提出方案,其中包括通过取证和证据调查,以确定科曼斯的解雇是否属于出于政治动机的程序正义违规及对公务员保护机制的破坏。
科曼斯的律师团队由多家律所组成,他们称此项裁决是反对行政权越界的“里程碑式”胜利。特朗普政府则援引宪法第二条为解雇行为辩护,主张总统有权罢免联邦雇员。此案凸显了围绕总统解雇权这一法律领域持续存在的紧张局势,最高法院近期也对此有所涉足。法院的最终裁决将权衡科曼斯作为职业公务员的权利与政府行政权力之间的界限。
30年期固定抵押贷款平均利率已攀升至6.55%,为近一年来的最高水平。这一持续的上涨,加之创纪录的房价,使房地产市场遇冷,导致6月份待完成房屋销售量下降了5.4%,建筑商的信心也随之减弱。
首次购房者尤其感到困难,许多潜在买家因负担能力受限,或不愿放弃当前较低的抵押贷款利率,选择继续观望。尽管环境充满挑战,但《21世纪住房道路法案》(21st Century ROAD to Housing Act)近期已正式成为法律。该立法旨在通过简化监管、减少繁文缛节,并向建筑商和购房者提供财政支持来降低住房成本。
然而,业内专家提醒,这些改革的实施尚需时日。目前,由于买家和建筑商都在等待抵押贷款利率改善及更明确的经济前景,房地产市场仍处于低迷状态。
一项近期针对 12,750 篇 arXiv 论文的研究表明,截至 2026 年中期,约 32% 的新提交论文读起来像是机器撰写的。为确保准确性,研究人员利用 ChatGPT 问世前(2021-2022 年)的论文对检测器进行了校准,并将误报率设定在 0.4% 的阈值。这一“基准线”考虑了学术写作中的自然差异,以确保观察到的 AI 风格文本的增长并非仅仅是统计上的误差。
数据显示,在 ChatGPT 发布后,这一趋势呈现显著上升,且不同领域的采用率差异巨大。计算机科学领域有 65% 的论文被标记为机器撰写,而数学领域则仅为 0.7% 左右。
然而,研究指出了以下关键局限性:
* **检测盲区:** 像数学这样高度依赖符号的领域,得分较低可能是由于检测器的“盲点”,而非缺乏 AI 使用。
* **结果解读:** 结果反映的是“机器化”写作的普遍性(包括大量 AI 辅助编辑),而非完全由 AI 撰写的证据。
* **低估倾向:** 由于检测器无法识别所有模型或提示词组合,报告的数字应被视为 AI 集成程度的下限。
研究人员得出结论,尽管学术界对 AI 的应用已相当广泛,但这些评分反映的是总体趋势,而非针对个人的指控。
华尔街再次利用复杂的金融工程,将高风险、流动性差的私募信贷资产重新包装成“投资级”证券。通过使用保险“包装”,相关公司能够为这些产品争取到高评级,从而显著降低持有这些产品所需的监管资本。
作者认为,这一趋势与2008年金融危机前夕的情况如出一辙,当时涉及抵押贷款支持证券和信用违约掉期的类似做法最终引发了全球金融崩溃。如今,保险公司、养老基金和年金提供商越来越多地暴露在这些不透明的杠杆结构中。由于这种风险目前已广泛分布于整个金融体系,这些机构已变得“大而不能倒”,实际上是在押注当基础资产最终表现不佳时,美联储会提供安全网。
通过转移和掩盖风险而非消除风险,金融业再次制造了系统性的脆弱性。作者指出,华尔街吸取的教训是错误的:他们没有避免鲁莽的押注,而是将其制度化了。这确保了未来任何灾难的代价都将高到政府无法忽视,从而将下一次不可避免的市场崩盘造成的损失社会化。
一位联邦法官已发布为期14天的临时限制令,阻止派拉蒙与华纳兄弟探索公司之间价值1100亿美元的合并案。这项禁令使以加州总检察长罗伯·邦塔(Rob Bonta)为首的12位民主党州总检察长联盟,在阻止该交易的行动中取得阶段性胜利。
各州主张,合并这两家媒体巨头将控制电影发行和有线电视的大部分市场,这抑制了竞争并损害消费者利益,从而违反了《克莱顿反垄断法》。尽管美国司法部在经过广泛审查后已批准了该合并案,但法律挑战依然存在。
派拉蒙若无法在9月30日前完成交易将面临巨额经济惩罚,该公司抨击该诉讼毫无根据。派拉蒙坚持认为,此次合并对于与现代科技平台及流媒体竞争对手抗衡至关重要。随着欧盟和英国的进一步监管审查,以及来自工会和消费者的私人诉讼,该合并案目前仍处于搁置状态。接下来的两周至关重要,双方正准备为媒体格局的未来展开激烈的法律博弈。
共和党全国委员会(RNC)已针对亚利桑那州、内华达州、科罗拉多州、新泽西州、弗吉尼亚州和内布拉斯加州提起了一系列诉讼,旨在堵住一个允许从未在美国居住过的人通过父母曾经的居住地进行投票的法律漏洞。
共和党全国委员会主席乔·格鲁特斯(Joe Gruters)主张,居住权应是投票的基本要求,并表示选举应仅由真正在该州居住过的人来决定。继近期在北卡罗来纳州取得胜诉后,共和党全国委员会正利用这一先例在其他地区挑战类似的法律。
这些诉讼专门针对从未在美国本土居住过的平民,将此类情况与《统一海外公民缺席投票法》(UOCAVA)所保护的军事人员及外交官区分开来。尽管共和党全国委员会坚称其努力是为了确保选举公正性,但包括内华达州州务卿弗朗西斯科·阿吉拉尔(Francisco Aguilar)在内的批评者认为,这些诉讼是对居住在海外的美国公民权利的攻击。阿吉拉尔认为,这些措施可能会对军人家庭产生负面影响,而共和党全国委员会则坚持其重点仅在于消除缺乏与该州实际联系的“推定居住地”声明。
为了提升火焰图分析仪表板的性能,团队将渲染方式从基于 SVG 转向了基于 HTML5 Canvas。
此前,SVG 使用的是“保留模式”(retained-mode)API,每一帧都是一个 DOM 节点,这迫使浏览器管理成千上万个元素。这种方式在样式计算、布局和垃圾回收方面产生了巨大的开销,导致在缩放或滚动等复杂交互过程中性能缓慢。
通过切换到“立即模式”(immediate-mode)API 的 Canvas,团队完全去除了 DOM。他们现在使用从 Rust 数据库发送并通过“零拷贝”策略处理的列式 Arrow 数据直接绘制像素。这使得应用程序能够根据实际可见内容而非总帧数进行扩展。
结果显著:在独立测试中,Canvas 渲染器的速度比旧版本快 3.6 倍。在实际使用中,缩放和重置的速度提升了约 4 到 11 倍,即使在 CPU 严重受限的情况下,界面也能保持流畅的 118 FPS。尽管这种转变需要针对点击测试和文本截断进行自定义实现,但它从根本上解决了基于 DOM 的大规模可视化中固有的性能瓶颈。
在这篇文章中,迈克尔·斯奈德(Michael Snyder)认为美国人正面临一场“令人窒息”的生活成本危机,而官方政府统计数据却未能反映这一事实。斯奈德强调了食品杂货、住房和租金价格的大幅上涨,并指出许多家庭为了满足基本需求,正日益依赖高利息信用卡和“先买后付”服务。这种财务压力反映在不断上升的拖欠率上,止赎案件数量也比去年增长了 21%。
斯奈德将大部分经济不稳定性归咎于地缘政治紧张局势,特别是与伊朗的冲突以及霍尔木兹海峡的关闭。他警告称,全球天然气供应(对氮肥生产至关重要)的中断威胁到了全球粮食供应。作者认为,这种对“哈伯-博施法(Haber-Bosch)纸牌屋”的脆弱性表明食品价格将持续飙升,导致长期短缺,甚至可能引发大范围饥荒。最终,斯奈德将当前的经济状况描述为一场历史性危机的早期阶段,并警告称,该国面临的金融和粮食压力只会加剧。
这份摘要概述了“推理模型”的演变与机制——这类大语言模型能够生成中间步骤的推理轨迹,从而解决复杂问题。
**推理模型的兴起**
随着 OpenAI o1 和 DeepSeek-R1 的成功,推理模型已成为行业标准。这些模型通常采用基于可验证奖励的强化学习(RLVR)进行训练,即根据模型最终答案的正确性给予反馈,从而自然地引导其在“思考”阶段学会回溯和自我修正。
**推理扩展与努力程度控制**
模型性能可以通过训练(模型规模)或推理(运行时消耗的算力)来提升。现代旗舰模型(如 GPT-5.6、Qwen3)现已提供可调节的“努力程度”。这使得用户能够通过牺牲速度和成本来换取更高的准确性。这些模式通常通过以下方式实现:
* **系统提示词/对话模板:** 调整模型的指令。
* **模式条件强化学习(Mode-Conditioned RL):** 通过不同的长度惩罚或代币成本来训练模型。
* **有监督微调/蒸馏(SFT/Distillation):** 通过有监督微调教会模型不同的响应风格。
尽管自动选择努力程度仍是未来的目标,但目前的实现方式主要依赖于用户明确定义的设置,从而在高效直接的响应与深度且耗费算力的推理之间架起了桥梁。
新发布的 Kimi K3 模型被誉为对标 Fable 和 GPT 的前沿级产品,近期对其优化复杂 Rust 函数的能力进行了测试。在被要求改进代码时,该模型建议使用 SWAR(寄存器内 SIMD)技术并行处理 8 位数值。
Kimi K3 在约 15 分钟内成功完成了优化,且未出现任何错误。最终代码使程序性能提升了 2%。考虑到它仅以 1 美元的 token 成本就准确识别并执行了复杂的优化,作者认为 Kimi K3 的性能确实与其它顶级 AI 模型相当。