每日HackerNews RSS

Kapa 构建了私有的**公司知识基准**,其中包含 1,000 条真实生产查询、历史语料库快照,以及用于检索最小完整权威信息块集的评判标准。由智能体生成的标签经过了 170 个人工标注案例的验证。 使用相同数据测试了七种检索器: - 混合搜索:**0.41**,0.4 秒 - 混合搜索 + 重排序:**0.50**,0.7 秒 - 查询分解:**0.56**,1.8 秒 - Kapa Default:**0.61**,3.3 秒 - 智能体 grep:**0.54–0.61**,13–17 秒 - Kapa Deep:**0.65**,5.1 秒 重排序是传统方法中成本最低的改进方案。智能体 grep 的效果与优化后的固定流程相当,但速度慢得多,每次查询约返回 40,000 个词元,成本也高得多。Kapa Deep 得分和精确度最高,同时每次查询仅返回约 5,000 个词元,因此是下游智能体使用成本最低的结果。 作者指出,所有受测检索器均由 Kapa 构建,因此该基准和测试结果可能存在产品偏差。

一篇标题为 **“针对智能体在杂乱的企业真实知识中的检索能力进行基准测试”** 的 Hacker News 帖子,由 kapa.ai 创始人、Y Combinator S23 校友 Emil Sorensen 提交,获得 26 分和 3 条评论。Sorensen 邀请大家就该项工作提问。 在一条评论中,用户 **politics** 询问了创始人对 BEAM、MemEval、MemoryArena 以及 Hugging Face 上其他基准测试的看法;Karpathy 的情景记忆/程序记忆/语义记忆框架(也称为 Doxa/Koine/Gnosis)的重要性;以及 kapa 的设计中哪些部分体现了该框架。他们还询问,kapa 是否会公开提取流程,以便企业能够使用自己的数据复现这项比较。 另一位评论者开玩笑地写道“enzinho bravo”,并建议申请 YC 的 2027 年冬季批次;该批次的申请截止日期是 11 月 2 日。

请启用 JavaScript 和 Cookie 以继续。

一则 Hacker News 讨论 examines? Need Chinese only. "分析了..." Let's formulate. One HN discussion analyzes evidence... recovered uranium cubes and bugged postwar conversations, suggesting... likely lacked... Commentators... "窃听的战后谈话" may be recordings obtained through surveillance. "受窃听的战后谈话". Britain postwar surveillance. "heavy-water plans" could be German heavy water production plans. "浓缩铀能力有限". "the Manhattan Project's enormous scale." "narrowly missing a viable design rather than years away" Means Germany was close to having a workable design, not years away. "只差一个可行方案,并非还差数年". Great. "modern parallels to nuclear escalation" maybe parallels drawn to modern nuclear escalation. "A lengthy dispute ... is rejected with references..." The claim/dispute is rejected based on eyewitness etc. "关于... lengthy debate, but commenters dismiss it..." Need readable. Let's ensure no title or intro.</mm:think>一则 Hacker News 讨论分析了缴获的铀立方体以及窃听所得的战后谈话。这些证据表明,纳粹德国曾开展核研究,但很可能缺乏制造原子弹所需的知识、材料、工业能力以及政治投入。评论者强调了德国在技术上犯下的错误、重水计划遭受的干扰、铀浓缩能力有限,以及曼哈顿计划庞大到难以相比的规模。 一些参与者认为,纳粹德国的反犹主义以及对现代物理学的排斥——将其斥为“犹太科学”——阻碍了德国核技术的发展,迫使关键科学家流向海外,而这些科学家后来协助了盟国。另一些人则强调,德国当时距离一种可行设计只差一步,而非还需要数年;他们同时承认,德国物理学家作出了重要的奠基性发现。 讨论还涉及英国战后对德国科学家的监控、日本不完整的战时核计划,以及现代核升级局势的相似之处。关于广岛是否真的发生了核爆,评论区展开了长时间争论,但评论者援引目击者证词、核试验影像和地震证据,否定了相关质疑。后来的评论转向美国与伊朗的紧张关系,以及人们对于针对平民的武器会进一步使核武使用正常化的担忧。

- **冲浪者场景:** 将冲浪者的黑色潜水服改为亮红色氯丁橡胶材质,同时保留其贴合度和高光。将白色冲浪板改为亮红色,保留其形状和反光。大型海浪、多云天空及其余黑白画面保持不变。 - **竹林场景:** 将霜冻小径左侧的微型拟人狼替换为狗。保留所有竹林、灯光、霜冻、原木、溪流、石灯笼、雪花、鸟类及其他背景细节。 - **笔记本插图:** 将抽象炭笔画替换为充满活力的水彩与墨笔植物插图,采用流畅的有机形态、青绿色和金色调,以及精细的线条。保持其尺寸和居中位置不变,并保留纹理背景、灰色卡片、绿色螺旋装订和印刷标题文字。

黑客们讨论 Black Forest Labs 的 FLUX 3 Image,赞赏其可控的用户体验:用户可以通过边界框和结构化控件放置、编辑元素。许多人认为,界面与模型本身同样重要,并将其与 Ideogram V4 基于 JSON 的构图方式以及 ComfyUI 工作流进行比较。对于 ComfyUI 的评价各不相同,有人认为它直观易用,也有人认为它无法胜任规模更大的项目。与此同时,智能代理和自定义 Python 脚本正逐渐取代手动编辑节点。 实际生成效果喜忧参半。一些用户称其提示词遵循能力很强,颗粒化编辑也很实用,尤其适合处理 UI 元素;另一些人则指出,它在处理物体关系、局部修改、文字、人体结构、透视和精细细节时容易出错。展示图因物体变形和几何结构不合理而遭到大量批评,不过一位详细评测者认为,它已经远胜于早期的 AI 生成结果。 BFL 表示,开放权重的 FLUX 3 Image 将在未来几周推出,可能采用非商业许可条款。这引发了用户的期待,同时也带来了许可方面的担忧。评论者还呼吁推出统一的模型对比工具,并讨论了精灵素材一致性、视频生成,以及视频模型是否应被视为世界模型等问题。

这些画家都是 AI 模型。每一个都通过编写程序,在一套模拟亚麻布油画的系统中作画:鬃毛画笔、湿颜料、干燥过程和分层罩染。整个过程不涉及任何图像模型。 大多数画家仅依据文字研究,模仿卡斯帕·大卫·弗里德里希的画风;它们从未见过他的作品图像。另一些则获得了自由创作的主题。有些画家会用一个程序完成整幅画;这里的 75 幅作品中,有 46 幅是在虚拟画架上逐段完成的,画完一段便后退观看。每一轮都会尝试不同的设置:按轮次展示。正在创作:工作室直播。

《黑客新闻》的讨论聚焦于 stillwet.art,这是一项实验:研究团队为 Claude Opus 5.5 提供了一个模拟的油画画布。模型并不直接生成图像,而是通过工具调用来混合颜料、控制虚拟画笔、用视觉能力检查画布,并反复修改或撤销自己的操作。实验结果引发了赞叹,也引发了讨论:这究竟体现了真正的推理能力、多模态泛化能力、可能的强化学习训练,还是仅仅是对现有工具的巧妙利用。 更大的争论围绕作者身份和意识展开。一些参与者珍视人类艺术,认为它是对真实生活经历的真诚表达;他们担心人工智能会造成经济冲击,或让人在发现作品由人工智能创作、却未被告知时感到受欺骗。另一些人则认为,人工智能的采用将取决于成本、质量和企业激励,并因此形成人类艺术与生成式艺术相互分离的市场。评论者还指出,这套系统对艺术家具有教育和练习价值;他们将其与机器人绘画机械臂和笔式绘图仪进行比较,指出模型会反复出现视觉错误和令人不适的重复,并建议将其扩展为标准化测试或实体艺术创作实验。

**agent-wow** 是一个用于评测《魔兽世界》中前沿大语言模型智能体的实验平台。智能体通过 WoW 网络协议直接连接到私有的 AzerothCore 服务器,并可自行构建模块,而不必依赖预定义的移动、战斗或交互机制。 在初步测试中,使用 GPT-6 Astra 的 Codex 被要求创建一名兽人角色,并完成起始区域的所有任务。它在 40 分钟内完成了任务,且全程没有死亡。它通过分析 AzerothCore 数据来获取任务要求和地点,优化任务顺序与技能配置,并生成协议桥接工具来交换和解码游戏数据包。它还利用服务器的导航网格编写了一个基于 C++ Detour 的寻路工具,不过偶尔会利用碰撞漏洞穿墙移动。 该项目旨在通过难度逐步提升的内容,测试智能体的长时程规划和实时战术执行能力,最终让服务器中充满智能体,并攻略冰冠冰川。未来工作包括实现自主升级至 80 级、多人协作、更完善的可观测性,以及通过沙箱限制不安全的服务器访问。

一则关于 GPT-6 Astra 通过 agent-wow 玩《魔兽世界》的 Hacker News 讨论引起了关注。它借助 AzerothCore 和游戏数据工具,在大约 40 分钟内完成了新手区域的连续任务,且全程没有死亡,随后便登出了游戏。 commenters 对 AI 玩家的价值存在分歧。支持者认为,明确标注身份的 AI 伙伴可以填补团队副本中的人数空缺、提供训练搭档、让玩家稀疏的世界更加丰富,还能让《谜题海盗》等已经停运的游戏重新活跃起来。批评者则警告,隐藏在真人玩家中的机器人可能会进一步破坏本就在衰退的社交生态,并为作弊和刷金币提供便利;而且几十年来,专用机器人已经能够高效完成这类操作。 一个反复出现的问题是:这样的成果在很大程度上依赖专用控制框架和结构化游戏数据,因此它未必能证明 AI 具备广泛而自主的游戏能力。总体而言,讨论者区分了两类 AI:一类是有用且身份透明的 AI 伙伴,另一类则是旨在取代或欺骗真人玩家的破坏性机器人。

智能体编程虽然很有用,但会在四个主要方面造成损害: 1. **大语言模型生成的“垃圾内容”会降低代码库质量。** 模型可能能力很强,但它们的输出往往草率、晦涩或难以理解。随着智能体接管越来越多的开发工作,工程师原本共享的人类工作空间也会变得陌生,不再具有吸引力。 2. **工程师会逐渐疏远自己的工作。** 把模糊的指令交给智能体,再审核它们提交的报告,会取代亲自编写代码的直接体验。这会削弱工程师的责任感、匠心、产品判断力和工作满意度。 3. **人工智能会侵蚀技能和学习。** 轻松实现自动化会削弱培养专业能力的动力,使新手和有经验的工程师都面临技能退化的风险。学会如何操作智能体,并不能弥补对软件运行原理的不了解。 4. **团队会失去其社会联系。** 与同事交流逐渐变成与智能体私下互动,从而减少协作、相互学习、展示技能和人与人之间的联系。 尽管人工智能提高了生产率,但它也可能让我们失去好奇心、匠心、能力和凝聚力。在这些品质成为便利性的牺牲品之前,我们需要找到一种可行的前进方式。

《黑客新闻》的讨论聚焦于“智能体编程的四骑士”:代码质量下降、团队沟通减弱、工程师主人翁意识淡退,以及提示 AI 的过程往往不公开或令人难为情。许多评论者提到,Slack 频道变得沉寂,工作进展由 AI 用笼统语言汇报,工作日益孤立,代码审查流于表面,而开发者还要确认那些自己并未完全理解的代码。他们担心,速度和公司压力正在侵蚀工匠精神、学习、导师机制、责任担当以及工程文化。 另一些人认为,这些问题源于实施不当,而非 AI 本身。据报道,成功的团队会将智能体与充分的上下文、测试、文档、架构标准、人工审查和明确的责任机制结合起来 Some say frontier models are already good enough for routine work, while complex business systems still require expert steering. The debate also covers automation’s broader economic impact, whether programming will become like mass manufacturing, and whether handmade software will remain a niche. Overall, the divide is less pro-AI versus anti-AI than craft versus scale, and productivity versus human development.

arXivLabs 是一个框架,使合作人员能够直接在 arXiv 网站上开发和分享新的 arXiv 功能。与 arXivLabs 合作的个人和组织均认同并接受我们的价值观:开放、社区、卓越和用户数据隐私。arXiv 坚持这些价值观,并且只与遵循这些价值观的合作伙伴合作。如果你有一个能为 arXiv 社区创造价值的项目创意,请进一步了解 arXivLabs。

一则关于“在不评估每个步骤的情况下解决 GRPO 信用分配问题”的 Hacker News 讨论,探讨了前沿 AI 实验室如何为训练实验选择方案。 commenters 认为,实验室会先在小规模上测试有前景的方法,然后再将其纳入更大规模的实验,并由高水平研究人员提供支持。另一名 commenter 则认为,增加算力投入以及迈向递归自我改进(RSI)的进展,部分目的正是为了支持这类大规模实验。 该帖子一天内获得了 23 分和三条评论。此外,它还推广了 YC 的 2027 年冬季批次,申请截止日期为 11 月 2 日。

Supabase 将 Turso 团队纳入旗下,共同为 AI 智能体开发数据库基础设施。这些智能体正在为数百万个原型和应用创建数据库。 现有用户不会受到影响:Supabase 将继续基于 Postgres 构建产品,Turso 将继续开发 SQLite。双方希望让数据库像文件一样低成本且易于创建,支持按需配置,并为从原型开发走向生产环境提供清晰的路径。 Turso 基于 Rust 的 SQLite 架构每台服务器可管理数百万个数据库,按需加载,并在空闲时暂停运行。该架构已支持在 Turso Cloud 和客户自己的云环境中部署。Turso 将继续独立运营,并逐步融入更广泛的 Supabase 生态系统。联合创始人 Glauber Costa 将负责新的智能体基础设施项目。

Supabase 正在收购 Turso。这是一款基于 Rust、兼容 SQLite 的嵌入式数据库。Supabase 表示,Turso 将作为 Postgres 的补充:对于原型、AI 智能体、边缘应用和小型项目,可按需提供低成本的 SQLite 服务;随着应用规模扩大,用户还可以迁移到托管的 Postgres。 据报道,Turso 将继续专注于 SQLite,并保持开源,采用 MIT 许可证。同时,它还将为 Supabase 即将推出的最小实例规格“Spark”提供支持。 The Hacker News 上的反应不一。支持者称赞了 Turso 的异步 I/O、并发写入、本地复制、PostgreSQL 兼容性、更安全的实现语言,以及更加开放的开发模式。Turso 的 CEO 表示,这次收购是一项战略行动,并非退出,并称公司收入增长强劲。 其他人则担忧,投入更多资源仍未解决 ClickBench 数据导入失败和性能问题。有人对收购导致开源项目被改造或终止持更广泛的怀疑,同时还有报道称 Turso 存在网络和监控问题。讨论还再次提出了一个问题:是否有必要重写 SQLite 这样成熟且经过实战检验的软件。SQLite 的创建者警告说,完成这样的重写需要付出非凡的投入。

请启用 JavaScript 和 Cookie 以继续操作。

一个 Hacker News 帖子链接到 Inside Climate News 的一篇文章,标题为“美国最大的煤炭生产商正在使用一项已过期的许可证运营”。文章本身未附上,但讨论的重点是这个标题是否具有误导性。 一名评论者称,阿拉巴马州的这座设施生产的是焦炭,而不是煤;美国最大的煤炭生产商位于怀俄明州。其他人则开玩笑说,这个错误看起来像是故意用来吸引愤怒的;他们还讨论了焦炭是否比煤危害更大,并认为这个问题无关紧要,因为据称许可证可以花很少的钱在法院续期。 该帖子获得了 18 个积分和 5 条评论。

特朗普政府正将 America.gov 定位为联邦政府的统一数字入口,并通过 Login.gov 为护照、福利、文件和各类机构服务提供可复用的身份验证。尽管 America.gov 表示不会使用广告 Cookie、第三方追踪器、精确位置数据,也不会保留聊天机器人历史记录,但其计划扩展至需要登录的交易服务,引出了更广泛的隐私问题。 Login.gov 最近为“国家设计工作室”(NDS)界面实验新增了“nds_experiment_uuid”Cookie。这个随机生成的浏览器标识符可在用户登录前创建,有效期最长可达 20 年,并会与分析事件关联。即使选择退出改版后的界面,也不会删除该标识符。Login.gov 公布的隐私评估早于这些变更,目前也没有单独列出的 America.gov 隐私评估。 尽管这种 UUID 本身并不构成全国性追踪系统,但将其用于联邦身份平台,可能使人能够长期关联界面活动、身份验证事件和机构访问记录。GSA 和 NDS 应说明该标识符的用途、数据保留期限、退出机制、可能产生的身份验证关联,以及隐私审查情况。

一场 Hacker News 讨论批评 America.gov 设置了有效期长达 20 年的 Cookie,这可能让访客被长期追踪。评论者质疑,一个面向访客的政府门户为何需要如此持久的标识符,并指出,现代浏览器通常会将 Cookie 的有效期限制在约 400 天以内。 讨论的核心是:永久登录会话究竟能带来便利,还是会造成不可接受的安全风险,尤其是对于包含敏感个人信息的政府服务。一方认为,用户不应被要求反复登录;另一方则强调,认证令牌应当设置过期时间,并建议采用明确的“记住我”期限、刷新令牌或定期重新认证。评论者还指出,长期会话对于低风险的消费类网站或许合理,但不适合 Login.gov、社会保障或税务门户等服务。 该讨论还包含对政府访问门槛的政治批评,以及关于 America.gov“SI”信息系统的玩笑。

更多

联系我们 contact @ memedata.com