Muon 优化器在函数空间采用了谱范数约束,为 Adam 等传统的参数空间优化器提供了一种强有力的替代方案。然而,将其应用于 Transformer 中的查询(Q)和键(K)权重矩阵时会导致训练不稳定,因为 Muon 的满秩更新可能导致奇异值(进而导致注意力 Logits)爆炸。 其根本原因在于双线性注意力运算($QK^T$)中 $W_Q$ 和 $W_K$ 的函数耦合。对这些矩阵单独施加约束无法控制其乘积,从而导致“MaxLogit”崩溃。虽然涉及伪逆和投影的耦合更新规则在理论推导上非常精妙,但其计算成本使其在实际应用中并不可行。 因此,研究重心已转向经验近似法。例如 **MuonClip** 等策略,通过基于批次内最大 Logit 值动态调整权重缩放或 Softmax 温度,作为理论谱范数约束的实用替代方案。尽管这些启发式方法缺乏通用证明的严谨性,但它们有效利用了批次内统计信息来稳定训练。归根结底,优化 QK 层所面临的挑战突显了一个更广泛的机遇:将 Muon 的函数空间理念应用于低秩结构,这可能成为弥合稳定训练与高效参数适配(如 Muon-LoRA)之间差距的桥梁。
SoundCloud 最近升级使用了 Fraunhofer 的 `libfdk_aac` 编码器,该编码器将音频质量置于频谱图的视觉连续性之上。用户可能会注意到上传曲目的频谱图在 17 kHz 处出现“硬截止”——这看起来像是质量损失,实际上却是性能的提升。
由于有损压缩在编码音频时拥有有限的比特预算,编码器必须对不同频率进行取舍。由于人类听觉对 17 kHz 以上频率的敏感度远低于对关键中频段(2–5 kHz)的敏感度,编码器会策略性地“牺牲”那些难以察觉的高频数据。通过切除这些高频部分,编码器将更多的比特分配给了人类可听的频谱,从而获得更纯净、更精确且伪影更少的声音。
归根结底,这是一种基于心理声学而非原始数据留存的权衡。尽管频谱图显示出较低的截止频率,但听众在人耳最敏感的频率范围内获得了更高的保真度。该编码器的设计初衷是优化人类的听觉感受,而非优化声音在图表上的视觉效果。