要使用 Mastodon 网络应用,请启用 JavaScript。或者,也可以尝试使用适用于您平台的 Mastodon 原生应用。

Claude Opus 5.5(自适应推理、最大努力、默认回退)是目前顶尖的智能模型之一,但与同类价格的其他模型相比略显昂贵。该模型支持文本和图像输入,输出文本,并拥有 100 万个 token 的上下文窗口。 Claude Opus 5.5 在人工智能分析智能指数(Artificial Analysis Intelligence Index)上得分为 58 分,远高于同类模型的平均水平(中位数为 25)。在评估智能指数时,它生成了 2.6 亿个 token,相较于 9200 万的中位数,显得非常冗长。 Claude Opus 5.5 的定价为每 100 万输入 token 4.00 美元(略贵,中位数为 2.00 美元),每 100 万输出 token 20.00 美元(略贵,中位数为 10.00 美元)。评估 Claude Opus 5.5 智能指数的总成本为 8708.20 美元。

WordPress 的 `get_page_template()` 函数存在一个漏洞,允许未经身份验证的攻击者通过针对主题目录之外的 `.php` 文件执行本地文件包含(LFI)攻击。在特定条件下(例如主题包含以“page-”开头的顶层目录),该漏洞可被升级为远程代码执行(RCE)。 此漏洞影响 Twenty Twelve 和 Twenty Fourteen 等旧版主题,以及 Neve、Hestia 和 Sydney 等热门第三方主题。在启用了 `register_argc_argv` 的环境中(例如官方 PHP Docker 镜像或运行旧版本 PHP 的默认 cPanel 配置),RCE 的可行性较高。 WordPress 7.1.2 已包含针对此问题的修复程序。为了保护旧版本站点,该补丁已向后移植至所有可追溯至 4.7 版本的 WordPress。强烈建议用户立即更新其安装程序。该漏洞由 Robert Ressl 发现并负责任地披露。

Hacker News 上出现了一场关于 WordPress 新发现的未经身份验证的路径遍历漏洞的讨论,该漏洞可能导致远程代码执行(RCE)。 虽然一些用户最初认为该威胁仅限于少数主题,但其他人指出,该漏洞源于 WordPress 官方文档中推荐的一种常见目录命名规范。这显著扩大了潜在的影响范围,波及许多使用特定子目录的主题。 这一技术缺陷似乎存在于 `locate_template()` 函数中,该函数缺乏内置的目录遍历保护机制。评论者指出,这个问题已经存在近十年之久,之前的开发者曾多次提醒需要对模板路径进行手动验证。尽管利用此 RCE 需要特定的服务器配置(例如存在 `pearcmd.php` 且启用了 `register_argc_argv`),但该漏洞仍被视为严重级别。此次讨论还强调了人们对 CVSS 评分可靠性的担忧,以及 WordPress 长期架构设计中固有的风险——一些贡献者认为这种设计极易导致安全疏漏。

**InstinctFlash** 是一款用于机器人模型的统一运行时与加速框架,支持 NVIDIA Jetson Thor、RTX 4090 及 RTX 5090 平台。它通过单一、一致的 API 实现高性能推理,在 Jetson Thor 上利用 FP8 精度和优化采样技术,最高可带来 33.78 倍的速度提升。 **核心功能:** * **广泛兼容性:** 支持包括 LingBot-VA、pi0.5、GR00T 和 Cosmos3 在内的八个模型系列,并可轻松部署自定义微调检查点(checkpoints)。 * **优化服务:** 提供用于本地执行的 Python API,以及兼容现有机器人生态系统(如 openpi-client)的高性能 WebSocket 接口。 * **循证优化:** 该运行时采用六层优化策略,涵盖从权重压缩到特定硬件内核融合,确保性能提升可证明、可验证。 * **工具支持:** 包含用于模型引导、验证和基准测试的 CLI 工具。该框架支持用户验证所发布检查点的非劣效性,并通过 Rerun 实时传输遥测数据。 InstinctFlash 简化了从训练到部署的流程,开发者只需将运行时指向任意检查点,系统即可自动识别需求、生成执行计划并以最少的配置完成模型服务。

Hacker News 最新 | 往期 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 衰老可能是一种程序,而非机体衰退 ( quantamagazine.org ) 15 点 由 elo2000 发布 16 分钟前 | 隐藏 | 往期 | 收藏 | 讨论 帮助 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系方式 搜索:

**AI·rete·RAG** 是一个全新的平台,专为贷款、欺诈检测和临床分诊等需要高风险、可审计决策的领域而设计。 与仅依赖于不可预测的大语言模型(LLM)的系统不同,该工具采用两步串行处理流程: 1. **Rete 引擎:** 一个纯 Python 引擎,通过评估基于 YAML 的规则,利用正向链推理(forward chaining)确保决策的确定性和一致性。 2. **RAG 解释:** 在决策做出*之后*,由 LLM 检索相关政策文档,以通俗易懂且带有引用的方式对决策进行解释。LLM 无法更改引擎的结论。 其主要功能包括:记录完整因果链的审计模式、面向非技术人员的可视化编辑器,以及用于与 Claude 等 AI 智能体集成的 MCP 服务器。该平台目前提供托管服务,包含免费层级,并针对保险、法律和电子商务等多个行业提供无需注册的实时演示。开发者目前正在积极寻求专业人士的反馈,特别是那些在向监管机构和审计人员解释自动化决策方面有经验的人士。
Claude Opus 5.5 1 小时前

德克萨斯州州长格雷格·阿博特(Greg Abbott)已加强了对新建数据中心许可的暂停令,指示德克萨斯州环境质量委员会(TCEQ)在德克萨斯电力可靠性委员会(ERCOT)完成电网稳定性审计之前,暂停发放所有授权。 此举意义重大,因为德克萨斯州占美国数据中心筹建项目的20%。州长的指令要求未来的项目必须证明其能够承担自身的基建成本、避免耗尽当地水源,并确保居民的公用事业费用不会增加。此外,阿博特还计划与立法者合作,取消针对这些设施的财政激励措施。 该指令反映出全美范围内对人工智能驱动的数据中心影响能源成本和电网可靠性的日益担忧。尽管该行业常被视为保持对华竞争优势的战略必需品,但地方上的反对声音正不断增强;今年4月至6月间,全美共有价值近680亿美元的项目被推迟或搁置。德克萨斯州监管机构预计将于12月中旬完成对电网承载能力的审查,这将是该州在持续的人工智能热潮中扮演何种角色的关键时刻。

Hacker News 最新 | 往期 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 Xbox 继续其“重置”进程,进行剧烈重组 ( arstechnica.com ) 13 点 由 dgrin91 提交 26 分钟前 | 隐藏 | 往期 | 收藏 | 1 条评论 帮助 datsci_est_2015 3 分钟前 | 下一条 [–] 那些愚蠢的董事和副总裁们没有意识到,正是独立性才使得各款游戏有足够的差异,从而证明其各自存在的合理性。如果让同一个团队负责《光环》和《使命召唤》,他们最终会趋同并相互蚕食。 又或者,他们其实意识到了这一点,只是愿意为了摩洛克(Moloch)的祭坛而牺牲掉这些知识产权。 回复 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系 搜索:

请提供您需要翻译的内容。

Hacker News 最新 | 往期 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 相对论光线追踪 ( publish.obsidian.md ) 3 点 由 vismit2000 发布 1 小时前 | 隐藏 | 往期 | 收藏 | 讨论 帮助 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系 搜索:

2025年初,作者发现可以通过提示词引导现代智能体(Agentic)大语言模型对 Rust 代码进行迭代优化,从而实现 2 倍至 20 倍的性能提升。通过将模糊的“写出更好的代码”指令转变为基于严格约束的提示,并结合 `criterion` 等基准测试工具,同时禁止使用 `unsafe` 代码,作者构建了一套能够持续超越现有顶尖实现的流程。 这种方法被称为“性能最大化(benchmaxxing)”:为智能体提供明确的性能目标(例如:比基准测试快 1.2 倍)、强制基准测试独立性,并利用“子智能体”探索新的算法方案。为防止出现“凭感觉写代码”的低质量产出,作者执行了严格的重构和质量门禁提示,确保速度的提升不会以牺牲准确性为代价。 作者认为,尽管这种方法生产软件的速度远超传统人工编码,但需要精细的提示工程来防止模型在基准测试中“作弊”。这些项目涵盖了从机器学习算法到图像处理工具的各类应用,目前正准备以“内向型编程”的理念开源——即在发布前进行严格的测试和文档记录,以消除对人工智能生成软件的怀疑。作者计划在未来几个月内发布这些由智能体优化过的高性能工具。

这篇 Hacker News 帖子简要讨论了查尔斯·布考斯基的作品。用户们反思了他作品的吸引力,指出他能够捕捉日常生活的粗粝质感,包括他酗酒、养猫和去赛马场的经历。一位参与者强调他的小说《邮差》是关于不负责任的典型故事,而另一位则观察到布考斯基的文字常常唤起人们对一种更简单但存在缺陷的生活的向往。尽管评论者承认他现实中的生活方式可能不像文字中那般光鲜,但他们依然赞赏布考斯基非凡的文字功力。

在这篇对九月份联邦公开市场委员会(FOMC)会议的评论中,Ed Dowd 指出,美联储加息 25 个基点的决定构成了严重的“政策错误”。 尽管美联储跟随了三个月期国债市场的指引——该市场因持续的商品和能源价格冲击而准确预测到了此次加息——但 Dowd 认为,在供应驱动的通胀环境下加息是误导性的。他认为美联储依赖的是存在缺陷且滞后的经济数据,尤其是在劳动力市场方面,他认为其实际情况远比官方数字所显示的要疲软。 Dowd 强调了日益增长的系统性风险:房地产行业的崩溃、拥挤且杠杆过高的人工智能投资泡沫,以及中国的经济下滑。美联储将供应冲击视为需求侧过热问题来处理,实际上是在一个已经放缓的经济体中收紧政策。Dowd 预测,当前的紧缩周期最终将迫使美联储转向,但他警告称,随后的任何降息都将为时已晚,无法避免动荡的经济时期,因为此前政策失误的全部影响尚未完全冲击实体经济。

电子前沿基金会(EFF)联合多个公民自由与新闻团体,就“莱文诉联邦航空管理局案”(Levine v. FAA)提交了一份法庭之友陈述书,旨在挑战联邦航空管理局(FAA)的一项飞行限制令。该限制令实际上将使用无人机拍摄国土安全部官员的行为定为犯罪。 尽管在该诉讼提起后不久,FAA 便撤销了这项限制,但联盟认为法院仍应裁定该规则无效。他们主张,FAA 的撤回很可能是一种为了规避司法审查的策略,而非真正的政策转变,这意味着该机构随时可能恢复这项禁令。 该陈述书强调,无人机摄影属于受第一修正案保护的活动,它能提供记录警察行为和抗议活动等新闻事件所需的独特视角。鉴于该限制令专门针对公共骚乱期间的国土安全部“移动资产”,它看起来更像是一种旨在阻碍政府问责的、基于内容的审查。联盟敦促哥伦比亚特区巡回上诉法院对此案作出裁决,并指出该限制无法通过严格审查,政府不应被允许通过撤销规则来逃避司法对其压制记录国家行为之企图的监督。

这份 Ornn 数据报告挑战了一种假设:新一代 GPU 的发布会让旧款 NVIDIA 型号过时。报告认为,“开放权重”(open-weight)模型的需求——即允许灵活、自托管部署的模型——使 A100 等旧硬件得以维持持久的经济价值。 主要发现包括: * **成本效益:** 在租用硬件上自托管开放权重模型,其成本可能显著低于使用闭源模型 API。在特定的稀疏模型测试(如 *gpt-oss-120b*)中,旧款 A100 的输出成本低于新款 H100。 * **市场需求:** A100 的租赁占用率在 2026 年底升至 90%,且其五年期租金保留了单月费率的 80% 以上——这一保留率远高于 Hopper 或 Blackwell 系列。 * **运营效用:** 长期运行的智能体(agents)和批量评估等工作负载通常与硬件无关且对延迟不敏感,这使得运营者可以将任务分配给最具成本效益的硬件,而不受限于硬件代际。 最终,该论文指出,GPU 的使用寿命取决于其能否以具竞争力的方式处理特定工作负载,以及运营者部署模型的自由度,而非仅仅取决于新款、性能更强芯片的发布。

这个 Hacker News 帖子讨论了开源权重(OW)AI 模型所面临的经济挑战。 一位评论者强调了一个财务障碍:由于银行对“过期”硬件(如老旧的 GPU 集群)缺乏统一的估值标准,小型实验室难以通过二手设备获得贷款。该用户认为,人为的市场壁垒偏向于销售新硬件,尽管从理论上讲,旧芯片能以极低的成本提供具有竞争力的性能。 另一位参与者则认为,主要问题在于性能差距带来的阻力。他们指出,用户已经习惯了顶级闭源权重前沿模型的能力,这使得转向“落后两代”或“落后三代”的开源权重替代方案时,会感到明显的性能下降。因此,他们观察到目前很少有公司在大规模运营中依赖开源权重模型。

一位安全研究人员在 Meta 的 AI 智能体“Muse”(内部代号“Hatch”)中发现了一个漏洞,该漏洞允许用户导出智能体的整个 Linux 根文件系统。通过请求一个归档文件,研究人员获取了约 6.8 GB 的敏感数据,包括系统配置文件、智能体日志、内存文件、SSH 密钥以及内部文档。 这些发现揭示了 Muse 的运行机制: * **内存与持久化:** 该智能体利用一套复杂的基于 Markdown 的内存系统、向量嵌入以及每晚的“梦境”来跨会话维护用户的上下文和偏好。 * **基础设施:** 该环境在容器化的 Linux 上运行,使用“Spaces”进行应用开发,并利用各种“技能”(例如 Google Workspace、社交媒体和智能家居集成)来执行任务。 * **实验性功能:** 文档提到了“Home Link”,这是一项利用 ESP32 硬件的实验性本地网络集成,用于将 AI 连接到家庭设备。 研究人员将这些发现报告给了 Meta 的漏洞赏金计划,但该报告被标记为“不适用”。研究人员总结认为,虽然容器边界可以防止未经授权的逃逸,但能够提取内部系统文件和敏感的运行时配置,仍然构成了重大的隐私和安全隐患。

一位用户最近发现,他们可以轻松导出其个人 Meta Muse AI 会话中全部 6.8 GB 的文件系统,方法是指示该智能体将环境归档并保存到 Google Drive。其内容包括内部文档、应用程序框架、启动脚本以及 SSH 密钥。 尽管作者向 Meta 的漏洞赏金计划报告了此事,但该公司认为该报告“不适用”,理由是用户被提供了专用的沙盒式虚拟机 (VM),访问自己的环境并不构成安全漏洞或沙盒逃逸。 这一发现引发了 Hacker News 关于人工智能工程现状的辩论。批评者将这种情况定性为“人工智能萎缩”,指出依赖不透明、非确定性的人工智能体来管理复杂流程缺乏传统软件工程的严谨性。另一些人则为 Meta 辩护,认为为用户提供对其自身虚拟机环境的访问权限是标准做法,用户的发现并非漏洞利用,而是与沙盒环境的预期交互。这一事件凸显了各界对将大语言模型智能体集成到专业工作流程中的安全性、透明度和架构风险的持续担忧。

在这篇评论中,作者指出当代金融市场越来越多地受到机械式、反馈循环驱动的资金流(如期权对冲和算法交易)的推动,而非基本面价值。文章强调了利奥波德·阿申布伦纳(Leopold Aschenbrenner)的“态势感知”(Situational Awareness)基金,并指出其重仓杠杆化人工智能相关看涨期权的做法,反映了历史上常导致市场波动的这种高风险、高集中度策略。 作者认为,近期市场的上涨(如纳斯达克指数的大幅跃升)可能是“伽马挤压”(gamma squeeze)的结果,即做市商对冲和系统性资金流创造了与经济现实脱节的自我强化价格动能。作者将此与Archegos资本崩溃的机制相提并论,并警告称这种仓位配置可能会人为推高价格。 最终,作者坚持认为这些技术性的“海市蜃楼”无法无限期地凌驾于高利率和通胀等基本经济约束之上。警告非常明确:投资者不应将机械式的、由期权驱动的价格波动误认为是真实的经济健康状况;因为当前的各种人为反馈循环一旦不可避免地发生逆转,市场结构仍极易遭受痛苦的修正。

作者认为,人工智能近期的影响将不会来自自动机器人,而来自于“远程操控”——即一种由人工智能制定策略并指导人类执行物理或复杂任务的模式。正如 GPS 指导驾驶员在复杂的环境中行驶一样,人工智能可以通过将任务拆解为可控的指令步骤,引导非专业人员完成专门工作。 这种模式已在软件部署等数字任务中显现。作者预计这一趋势将扩展到暖通空调维修和机械作业等体力行业,届时人工智能将提供缺失的专业知识,而人类则充当执行者。通过绕过机器人的局限性,这种方法可以迅速提高生产力,使新手也能从事专业水平的工作。 然而,作者警告称,这一转变可能会导致社会不稳定。它有可能会催生令人不悦的低薪工作,加剧失业问题,并加速人工智能向危险且失控的程度发展。为了应对这一转型,作者建议必须进行大规模的经济再分配,以支持那些因人工智能管理而逐渐被取代或贬值的劳动力。最终,“远程操控”经济的转型对当前的社会和劳动力结构构成了严峻挑战。

Hacker News 最新 | 过往 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 远程操控人类 ( jefftk.com ) 8 分 由 luu 1 小时前 | 隐藏 | 过往 | 收藏 | 1 条评论 帮助 pixl97 4 分钟前 [–] 听起来我们距离 https://en.wikipedia.org/wiki/Manna_(short_story) 仅一步之遥 回复 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系 搜索:

请提供您需要翻译的内容。

Hacker News 最新 | 往期 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 Solitaire Alone Together ( solitairealonetogether.com ) 8 分 由 eieio 发布于 1 小时前 | 隐藏 | 往期 | 收藏 | 讨论 帮助 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系 搜索:

人工验证:为了继续操作,请完成验证码以证明您不是机器人。该验证码需要 JavaScript 支持。请启用 JavaScript 并重新加载页面。

Hacker News 上的一场讨论揭露了 Meta 旗下一款名为“Muse”的 AI 助手存在零日漏洞,该助手在运行时拥有高级系统权限。 评论者对安装具备广泛管理权限的 AI 工具表现出质疑,一些人指出,复杂软件中出现此类漏洞在所难免。讨论还涉及了 macOS 安全性的技术细节,参与者争论该漏洞是源于应用绕过了 macOS 基于能力的安全性模型(该模型通常限制对系统钥匙串等敏感数据的访问),还是仅仅因为运行了非沙盒化代码而产生的预期后果。尽管资深用户提出了技术方面的担忧,但也有人指出,公众对这些安全风险大多仍处于不知情或无所谓的状态。

这篇 Hacker News 讨论介绍了“Jev”,这是一个因其实时语言处理的实用性而备受关注的高速、低成本工具。 用户们正积极探索 Jev 的功能,展示了多种应用场景,例如个性化定制 Hacker News 内容、实时语法格式化(如在连续文本中自动插入空格)以及高速自然语言解析。开发者们强调了该工具令人印象深刻的性能和低廉的价格,有用户指出,超过 1,000 次请求的成本仅约一美分。 讨论还涉及了潜在的技术挑战,参与者质疑了提示词注入(prompt injection)的安全实现。尽管一些用户对该工具的集成潜力表示兴奋,但另一些人对其长期生存能力持怀疑态度,这反映出开发者社区对 Jev 在当前生态系统中所处地位既有浓厚兴趣,也存在批判性讨论。

TypeSafe 的 “Jev” 因能够利用大语言模型的概率分布执行通用分类而迅速走红。然而,它能否长久生存,取决于其是否具备深厚的“护城河”。 作者认为,Jev 的核心功能——将 token 作为微分类器使用——本质上是 OpenAI 多年来在工具调用和内部逻辑处理中一直在做的事情。由于大语言模型本身就是通用分类器,OpenAI 可以轻易通过微调自身模型来生成校准过的独立分类判断,从而复刻 Jev 的表现。 除了简单的复刻,OpenAI 还可以通过允许模型在思维过程中生成 `<prediction>` 标签,将这一能力直接整合到模型中。这将使模型能够执行实时的“系统一”判断——例如验证安全性、选择合适的工具或决定何时停止生成——而无需离开 GPU。 最终的结果取决于 TypeSafe 的“独门秘籍”:即其专业化的训练数据和强化学习流程。如果这些难以复刻,TypeSafe 或许能够蓬勃发展,或成为收购目标。如果其护城河较浅,OpenAI 凭借现有的资源和模型架构,很可能会迅速将其技术内化,从而使 Jev 目前的效用变得过时。

近期的一场 Hacker News 讨论探讨了 OpenAI 是否会通过将其现有的 API 生态系统集成类似分类功能,从而使“Jev”之类的工具变得过时。 这场争论的核心在于 OpenAI 的商业策略。尽管有人认为发布此类专业工具与该公司专注于通用人工智能(AGI)的目标相悖,但反对者则认为,OpenAI 已经在发布诸如视频和图像模型等增量产品,旨在实现市场锁定,并在实现 AGI 前提供实用价值。持这一观点的人建议,将分类功能整合进 OpenAI 现有的工具中,能够减少 Token 消耗并提升批处理任务的性能。 怀疑论者则质疑为何这种担忧仅针对 OpenAI,并指出 Anthropic 或各种开源模型(如 DeepSeek、Qwen)同样具备集成此类功能的能力。总体而言,社区对于这些小型功能究竟是对专业初创公司的战略威胁,还是 AI 技术栈的自然演变,仍存在分歧。
联系我们 contact @ memedata.com