请启用 JavaScript 并关闭所有广告拦截器
请启用 JavaScript 并关闭所有广告拦截器
在这项研究中,Akhtar 等人探讨了“基准饱和”(benchmark saturation)这一关键问题,即随着人工智能模型性能达到平台期,基准测试逐渐失去区分不同模型能力的效果。 研究人员利用 14 项与饱和度相关的指标分析了 60 个语言模型基准测试。结果显示,近一半的基准测试已经饱和,且基准测试存在的时间越长,饱和的可能性就越高。与某些假设不同,该研究表明公开测试数据的存在并非导致性能下降的主要原因;相反,构建稳健评估工具的关键在于专家策划。 最终,作者认为,通过优先考虑特定的设计选择,研究人员可以延长基准测试的寿命,并为人工智能的未来发展建立更具持久性的评估框架。
苹果公司已针对 OpenAI 升级了法律诉讼,寻求初步禁令以阻止其开发任何涉嫌基于窃取苹果商业机密而构建的人工智能产品。在一份新的法庭文件中,苹果请求加快取证程序,声称调查已发现涉及除最初点名人员外至少 11 名离职员工的证据。该公司列举了离职员工共享机密文件及违规保留工作设备的案例,表明这是一种更广泛的知识产权盗窃模式。 OpenAI 否认了这些指控,认为禁令请求毫无必要且基于虚假信息。该公司坚持其对苹果的专有数据没有兴趣,并称苹果的指控是一种干扰手段。此外,OpenAI 指责苹果此前存在程序错误,例如错误识别员工身份,以及未能解决其自身导致前员工仍能访问系统的内部安全疏漏。随着法律纠纷的加剧,苹果继续推动取证程序,以证明所谓不当行为的严重程度。
MMI 5300 是 20 世纪 70 年代初一款具有里程碑意义的 PROM(可编程只读存储器)芯片,它利用镍铬熔丝和二极管的独特架构存储了 1024 位数据。与现代存储器不同,5300 是“一次性写入”的:用户通过施加高压脉冲熔断特定的熔丝,从而创建永久性的非易失性记录。
该芯片采用 33×33 存储网格,通过复杂的地址解码逻辑选定 256 个 4 位字。由于 PROM 在出厂时预置为 1,因此测试难度极大;制造商为此额外增加了一行和一列熔丝,以便在出货前验证电路。该芯片还采用了模块化硅片设计,只需改变顶层金属布线,即可将同一晶圆布局重新用于不同版本(例如三态输出变体)。
尽管这些芯片对早期计算至关重要,但最终被可擦除的 EPROM 以及后来的现代闪存所淘汰。这一演变凸显了技术的巨大飞跃:1971 年的 MMI 5300 以 70 美元的价格提供 128 字节的永久存储空间,而今天的闪存驱动器只需极低的成本即可提供其数十亿倍的容量。
在线广告提供商 Adform 近期遭遇了安全漏洞,黑客借此向其投放的广告中注入了恶意代码。由于 Adform 每天提供约 15 亿次广告展示,此次事件可能影响了大量用户。 该恶意代码专门针对加密货币用户,通过监控电脑剪贴板进行攻击。它每三秒钟就会将用户原本要使用的加密货币钱包地址,替换为黑客控制的地址,从而增加用户不慎将资金转给黑客的风险。 Adform 已证实发生此次安全漏洞,但对于漏洞产生的原因或受害者总数仅提供了有限的信息。该公司目前正在调查黑客是否还获取了用户的浏览记录。 安全专家强调,这一事件是使用广告拦截器的强有力理由。通过阻止第三方广告网络加载代码,用户可以有效地保护设备免受此类恶意脚本的侵害,并防止普遍存在的追踪和监视。此次安全漏洞再次严正提醒人们恶意广告带来的风险,以及保持强大且主动的浏览器安全防护的重要性。
正在检查您的浏览器……需要启用 JavaScript
本项目展示了一种定制的色彩空间,旨在为角色创建器和艺术软件等数字工具提供一套兼具包容性与实用性的肤色方案。针对当前数字调色板过于局限或过于复杂的现状,作者通过结合数据科学与人工迭代,创造出一种“足够好”的解决方案。
该方法论包括:手动标记一组合理的肤色数据集,应用主成分分析(PCA)对数据进行组织,并利用人工函数拟合将这些颜色映射到球坐标系统(TUV空间)中。这使得开发者只需调整一个半径参数($R^2$),即可轻松采样肤色,并控制输出结果的多样性和变化程度。
尽管作者承认这种“非科学”方法存在局限性,包括色彩感知的固有主观性以及生物肤色的复杂性,但该项目为程序化生成提供了一种功能性且轻量化的工具。最终,这项工作为他人提供了一个透明且可迭代的框架,强调了虽然完美的解决方案可能并不存在,但该工具提供了一种比标准取色方法更有意图的选择。
由于对 Wordle 官方统计数据缺乏详细分析感到不满,作者利用四年来每日的 WhatsApp 游戏结果,对自己的个人游戏表现进行了深入研究。通过用 Python 脚本解析导出的聊天记录,他们绕过了 Wordle 服务器端追踪的局限性,构建了一份全面且独立的个人游戏历史记录。
对自 2022 年 1 月以来 1,552 场游戏的分析显示,其胜率为 99.4%,且游戏难度随时间推移呈明显的上升趋势。尽管作者的日常习惯(如清晨游玩、使用固定的开局词)保持不变,但平均每局的猜测次数却稳步增加,这很可能是因为常用词汇已被耗尽。数据还推翻了几个假设:在“繁忙”的早晨玩游戏并不会影响表现,且失败也不会对后续游戏产生负面影响。
最终,该项目将一个简单的日常习惯转化为了有意义的数据集。通过掌控自己的“Wordle 遗产”,作者获得了官方应用程序无法提供的关于自身作为玩家进化的细致洞察。
在孤岛中进行“氛围编码”(Vibe coding)会产生技术债务和难以管理的 PR。**ADLC 团队技能**(十二要素智能软件开发生命周期的一个开源组件)通过为工程团队提供共享的、版本控制的**认知层**,取代了零散的个人提示词工程。 通过整合团队章程、产品策略 (PDR)、架构标准 (ADR) 和评估基准,ADLC 将 AI 智能体从孤立的猜测者转变为负责任的团队成员。 **核心功能:** * **团队 AI 指令:** 一个基于 Git 的中央仓库,在会话开始时自动将团队上下文整合进智能体的系统提示词中。 * **规范驱动的工作流:** 通过 `mission-brief`,团队从对话式提示转向基于契约的执行,遵循 `规范 → 规划 → 实现` 的闭环。 * **治理与评估:** 实施“验证优先”的开发模式;在人工审查之前,通过自动化的 LLM 评判和快速检查,根据业务风险对代码进行验证。 * **构建即删除(Build-to-Delete):** 一个系统的反馈循环,随着模型能力的提升,自动剔除过时的规则。 * **通用编排:** 与供应商无关,开箱即用,支持 Claude Code、Cursor、Copilot 等工具。 ADLC 使团队能够“调试规范,而不只是调试代码”,从而确保整个组织内 AI 工程的一致性、可追溯性和可扩展性。