每日HackerNews RSS

在这项研究中,数据科学家 Dylan Castillo 调查了人工智能实验室是否在进行“鹈鹕最大化”(pelicanmaxxing)——即专门微调模型以在 Simon Willison 推广的“鹈鹕骑自行车”这一热门基准测试中取得优异表现。 Castillo 利用八种动物和六种交通工具的组合,在七个前沿模型中生成了 1,008 张 SVG 图像。随后,他使用大语言模型评估员和自动化特征提取技术对结果进行了定量分析,旨在寻找预示模型针对“鹈鹕骑自行车”这一特定提示词进行过预训练的性能峰值。 结果并未提供针对性优化的证据。鹈鹕和自行车的表现并不比其他动物或交通工具更好,且没有任何模型在“鹈鹕骑自行车”这一组合上表现出统计学上的显著提升。尽管研究指出所有 21 张鹈鹕骑自行车的图像均朝向右侧,但这符合模型生成图像的普遍趋势,即动物和交通工具很少被描绘成面向观察者的视角。 Castillo 总结称,虽然各实验室可能正在提升其整体的 SVG 生成能力,但没有证据表明它们在“钻空子”以应付 Willison 提出的这一著名基准测试。完整的代码和数据已发布在 GitHub 上,供公众进一步审查。

这篇 Hacker News 帖子讨论了一篇博文,文中质疑 AI 实验室是否在进行“鹈鹕最大化”(pelicanmaxxing)——这是一个戏谑的说法,暗示他们可能在通过刷榜或专门针对“鹈鹕骑自行车”这类小众提示词来微调模型。 评论者们探讨了这种行为背后的技术影响。一位用户指出,目前的专业 SVG 模型在处理这些特定提示词时效果更佳。另一位用户认为,如果前沿实验室真的在进行“鹈鹕最大化”,他们会直接将此类增强数据整合到训练集中,而不是使用简单的提示词技巧,尽管他也承认想到数据标注员生成数千张动物交通工具图像的画面十分滑稽。最后,一位用户提到,每种 AI 模型在这些多样的生成示例中都保持了令人印象深刻的风格一致性。

目前,数百亿美元的 AI 基础设施建设依赖于以 GPU 集群作为抵押的债务融资。然而,这种融资模式建立在不稳固的基础上。与飞机或航运等成熟资产类别不同,GPU 集群缺乏成熟的价格发现机制、对冲工具和标准化的维护记录。 这些集群的真实价值取决于其“运行状态”——这是一种由专业团队执行的复杂且无形的技术工艺,负责处理持续的硬件故障和静默数据损坏。如果借款人违约,债权人虽然有权接管这些集群,但他们缺乏保持其正常运转所需的运营专长或系统知识。此外,这些资产在账面上的“票面价值”(通常基于激进的六年折旧)与其实际市场价值之间存在巨大且充满争议的差距;由于芯片创新周期仅为一年,其实际价值面临着极大的波动性。 尽管目前贷款方通过收取高额溢价来抵消这种难以估量的风险,但该系统依然脆弱。在稳健的二级市场和标准化的运营监管机制出现之前,支撑这场 AI 热潮的抵押品,本质上仍是对资产的一种投机性押注,其耐用性可能远低于金融结构所预期的水平。

Hacker News 最新 | 过往 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 没人知道二手 GPU 集群值多少钱 (ciphertalk.substack.com) 15 分,发布者:rbanffy,1 小时前 | 隐藏 | 过往 | 收藏 | 2 条评论 帮助 tyfon 10 分钟前 | 下一条 [–] 我甚至怀疑英伟达会像法拉利那样,与大客户签订回购协议,以防止他们升级设备时市场价格崩盘,并维持稀缺性。但我希望不是这样,或许几年后它们在公开市场售卖时,我也能买到一张 H100。 回复 semiquaver 8 分钟前 | 上一条 [–] 这篇文章也许有些有用的观点,但那种令人痛苦的、由大模型生成的文风实在太让人出戏了,根本看不下去。 回复 考虑申请 YC 2026 年秋季批次!申请截止日期为 7 月 27 日。 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系 搜索:

Gigatoken 是一款专为语言模型设计的高性能分词器,其文本处理速度可达 GB/s 级别,通常比 HuggingFace 的分词器快 1000 倍。它支持现代 x86 和 ARM CPU 架构上的几乎所有常用分词器。 **主要特性:** * **性能:** 通过 SIMD 优化预分词、减少分支预测以及高效的预分词映射缓存,实现了极高的吞吐量。 * **兼容性:** 提供“兼容模式”,可作为 HuggingFace 和 tiktoken 的直接替代品,用户只需极少的代码修改即可集成。 * **可扩展性:** 原生 Gigatoken API 通过直接读取数据绕过了 Python 开销,从而实现最大程度的并行处理。 虽然主要针对 BPE 分词器进行了优化,但它旨在跨各种架构提供一致的高速性能。用户可以使用内置的 `gigatoken bench` 命令行工具验证吞吐量和准确性。目前,该项目优先支持 BPE,并计划进一步降低 Python ABI 开销,同时扩展对 WordPiece 和 SentencePiece 等其他分词器类型的支持。 Gigatoken 支持大规模数据处理,例如在 6.5 小时内完成整个 Common Crawl 的分词,这使其成为研究人员和开发人员处理大规模数据集的关键工具。

**GigaToken** 是一个宣称比标准语言模型分词器快约 1000 倍的新型库。其创作者 Marcel Roed 指出,这些性能提升在现代 x86 和 ARM 架构上均表现一致,而非局限于特定的 CPU 或单一分词器。 该项目通过以下几项关键优化实现了这一速度: * **高效预分词**:使用 SIMD 加速实现替代了缓慢的传统正则表达式引擎,从而最大限度地减少了分支处理。 * **高级缓存**:针对已出现的词汇实现了高度优化的查找表,解决了在缓存中管理长尾词汇分布的难题。 * **最小化开销**:减少了线程间的交互,并最小化了与 Python 之间昂贵的上下文切换。 尽管一些用户质疑此类速度在实际应用中的必要性,但 GigaToken 在一个通常受限于低效字符串处理的领域中,展现出了显著的工程改进。

跳至内容 新对话 搜索对话 图片 聊天记录 新对话 图片 插件 深度研究 查看方案与定价 设置 帮助 获取为您量身定制的回复 登录以基于已保存的对话获取答案,并创建图像和上传文件。 登录 ChatGPT 登录 免费注册 ChatGPT 是人工智能。使用即表示您同意我们的条款和隐私政策。对话可能会被审核并用于改进我们的 AI 模型。了解更多 语音

近期的一场 Hacker News 讨论分享了一份数学家陶哲轩(Terence Tao)使用 ChatGPT 探索雅可比猜想(Jacobian Conjecture)反例的对话记录。 评论者对陶哲轩与该模型的互动方式深感着迷,并指出他的方法反映了其他专家使用大语言模型(LLM)的方式:通过提出简短、专业术语密集且切中要害的问题,迫使人工智能在高级技术水平上运作。观察者认为,该模型发挥的作用不像是一个基础搜索工具,而更像是一位知识渊博的同行,能够有效地匹配其使用者的专业水准。 此次讨论为人工智能“副驾驶”在高度专业领域中的潜力提供了一个实际演示。尽管一些参与者争论这究竟是代表了真正的智能,还是仅仅表现为复杂的模式匹配,但社区普遍将其视为一个重要的里程碑。这凸显了专家如何利用人工智能来精炼复杂的探究路线,为未来技术驱动的协作研究提供了一瞥。

本分析旨在评估 Nvidia NVLink 对于双卡 RTX 3090 AI 工作负载的必要性。 测试表明,对于使用高端服务器硬件(提供完整的 PCIe Gen4 x16 通道)的用户,NVLink 大多是不必要的。当使用非官方补丁绕过 Nvidia 对点对点(P2P)通信的驱动程序限制时,标准的 PCIe 性能在大多数任务中几乎可以媲美 NVLink。 然而,NVLink 对以下两类用户仍然具有价值: 1. **消费级平台:** 大多数消费级主板会将 PCIe 通道拆分(例如 x8/x8),从而限制性能。NVLink 可以绕过这些物理带宽限制,无论插槽配置如何,都能保持高速运行。 2. **软件限制:** Nvidia 人为限制了消费级显卡的 P2P 功能。如果您无法使用 Linux 或不愿应用第三方驱动程序补丁,NVLink 是实现最大 GPU 间带宽的唯一途径。 **核心结论:** * **工作负载影响:** FSDP 训练从 NVLink 中获益最大,尤其是在受限的 PCIe 通道上。推理(张量并行)则有适度提升。 * **成本效益:** 在花费 200 至 400 美元购买桥接器之前,请将其成本与升级到提供原生全带宽 PCIe 通道的工作站或服务器级平台的成本进行比较。

```Hacker News 最新 | 过往 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 NVLink 何时值得入手?(platform-fools.com) 12 分 | ak_t 发布于 3 小时前 | 隐藏 | 过往 | 收藏 | 2 条评论 | 帮助 colingauvin 8 分钟前 | 下一条 [-] 好文章。我之前还在纠结要不要花 500 多美元给我的两块 A4500 买个 NVLink 桥接器用于推理。这篇文章基本证实了,只有在你的 PCI-E 拓扑结构极其不合理的情况下,它才有救场的作用。 回复 xiconfjs 6 分钟前 | 上一条 [-] 感谢 回复 考虑申请 YC 2026 年秋季批次!申请截止日期为 7 月 27 日。 指导原则 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系 搜索: ```

SWING NYC 0MPH 正在生成曼哈顿体素…… 【鼠标左键】按住进行蛛丝摆荡 · 在弧顶松开 【W A S D】在地面和空中控制方向 【空格】点击跳跃 · 按住并松开进行超级跳 【空中按空格】向所指方向空中冲刺(每次摆荡限一次)· 按住进行蛛丝摆荡 【Shift】俯冲 —— 用高度换取速度 【R】在屋顶重生 🕸 按住进行蛛丝摆荡 · 在弧顶松开 【摇杆】移动 · 拖动屏幕右侧控制视角 【跳跃】点击跳跃 / 空中冲刺 · 按住并松开进行超级跳 【俯冲】按住进行加速俯冲 点击开始摆荡 音乐 — “POWERUP!” BY JEREMY BLAKE ❚❚

Hacker News 新内容 | 过往 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 Show HN: 在纽约市中心荡秋千 (swingnyc.com) 15 分,shahahmed 发布于 1 小时前 | 隐藏 | 过往 | 收藏 | 6 条评论 Brainspackle 2 分钟前 | 下一条 [–] 坏了 回复 shahahmed 1 分钟前 | 父评论 | 下一条 [–] 哪里坏了? 回复 jeromechoo 32 分钟前 | 上一条 | 下一条 [–] 实际上挺有趣的。能够自动吸附到最近的建筑物,确保你永远不会掉进虚空,这一点考虑得很周到。 回复 shahahmed 29 分钟前 | 父评论 [–] 添加吸附建筑的标识确实很有帮助。很高兴你喜欢! 回复 sjacob 29 分钟前 | 上一条 | 下一条 [–] 刚才坐在市中心的一栋楼里玩了这个。很有意思。 回复 shahahmed 28 分钟前 | 父评论 [–] 你找到你所在的楼了吗?这是基于 OpenNYC 制作的。 回复 考虑申请 YC 2026 年秋季批次!申请截止日期为 7 月 27 日。 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系方式 搜索:

第04回合 > 与卫兵交谈 “你好,我刚来米德尔汉姆。你能告诉我关于‘卫队’的事吗?” 这里没有叫这个名字的人。 第05回合 > 与卫兵交谈 “打扰一下,你知道在哪里能找到卫队的警官吗?” 这里没有叫这个名字的人。 第17回合 > 与街头水晶交谈 “你好,你能帮帮我吗?” 这里没有叫这个名字的人。 第36回合 > 与队长阿拉里克爵士交谈 …… [在队长处连续15个回合 · 目标从未完成]

研究人员发布了“CrucibleBench”,这是一项概念验证研究,旨在探索基于文本的 MUD(多用户虚拟世界)是否可以作为评估大语言模型(LLM)的有效环境。该实验预算仅为 99 美元,从四个行为维度对大语言模型进行了测试。 该研究最重要的发现是,使用基于大语言模型的“裁判”进行性能基准测试并不可靠。当研究人员比较两位不同的 AI 裁判时,发现它们之间的一致性较低(介于 22% 到 85% 之间),这表明模型排名会根据所使用的裁判而产生巨大波动。作者指出,这种不一致性可能反映了内在偏见,尤其是当裁判模型与目标模型属于同一架构系列时。 尽管该研究受到样本量小和缺乏人工验证的限制,但研究人员已公开了其方法、数据和代码,以鼓励进一步的发展。该项目在社区内引发了关于文本游戏衰落的广泛讨论,以及通过整合现代人工智能和自适应游戏机制来重振该类型的潜力。第二阶段的规划正在进行中,目标包括加入人工基准测试和更稳健的评估环境。

随着人工智能将编程和写作等技术技能商品化,人类进步的真正瓶颈已从“能力”转向“意图”。随着造成“严重损害”的成本降至接近于零,行动者的个人素质与道德已成为最终的约束条件。 道德并非一种被动的氛围,而是一项严谨且可培养的技能,它涉及道德意识、冲突中的推理、对二阶效应(深远影响)负责,以及在压力下坚持原则。人工智能使这一点变得更加关键,因为它扩大了道德失误的规模,使决策速度超出了制度监督的范畴,并造成了决策者与后果之间的心理隔阂。 当前的社会和政治体系往往奖励那些缺乏这种内在“刹车机制”的人,比起诚信,体制更倾向于鼓励操纵和盲目自信。当这些人手中掌握了能进行工业级规模煽动的工具时,灾难的风险便随之上升。 我们无法将道德判断外包给防护栏或算法。未来十年的真正价值不在于一个人能“做什么”,而在于识别“什么值得做”的能力。现在最重要的工作,在于培养那种即使付出个人代价,依然能够坚守底线的勇气。

这篇 Hacker News 讨论聚焦于《伦理是当下最重要的技能》一文。该讨论串展现了人们对于现代伦理现状的深刻怀疑与分歧。 许多评论者质疑该文章的真实性,因其语调平庸且结构僵化,将其斥为“大语言模型垃圾内容”。除了对作者身份的讨论,辩论还转向了伦理堕落的本质: * **系统性失灵**:一些人认为现代机构被设计为“永动机”,优先考虑合规而非真正的道德,奖励那些撒谎且缺乏同理心的人。 * **地缘政治**:另一些人将伦理的缺失归因于单极世界秩序的衰落,指出当今世界正转向封闭、保护主义和侵略性的领导模式。 * **玩世不恭**:一个突出的观点认为,当前的经济体系——常被描述为优绩主义的幌子——系统性地排除了有道德的人,使得“伦理”成为职业成功的负资产。 最终,参与者们讨论了伦理究竟是在腐败的制度化世界中迷失的美德,还是文明的基本必需品——文明需要一段集体的“冷静期”来重新找回它。

DeepSQL 是一款人工智能数据库管理员与数据工程师,旨在优化数据库性能并降低最高 38% 的成本。它充当数据库的智能“大脑”,能够监控工作负载、分析慢查询并生成商业智能(BI)仪表板。 主要功能包括: * **自托管安全:** 完全在您的私有云(VPC)内运行,确保数据和凭据绝不会离开您的基础设施。 * **快速部署:** 只需一条简单的命令,15 分钟即可完成安装。 * **智能上下文:** 与您的数据库架构和业务逻辑(如特定的收入定义)集成,提供高度准确且可操作的洞察。 * **灵活接口:** 用户可以通过 Web UI、命令行界面(CLI)与代理交互,或通过 MCP 连接到 Cursor 或 Claude 等工具。 DeepSQL 自动化了繁重的数据库管理工作,使团队能够通过自然语言诊断性能瓶颈并获取复杂的业务洞察。无论是优化索引还是追踪数据摄入量,DeepSQL 都能让您的数据库实现自动驾驶,在无需额外开销的情况下提供专业级的可观测性与维护能力。

DeepSQL 是一款可自托管的 AI DBA 智能体,旨在为 PostgreSQL 和 MySQL 提供自动化数据库管理。该工具由前 Oracle 查询引擎工程师开发,最初是 Stayflexi 内部用于优化数据库性能、降低基础设施成本及管理模式膨胀(schema bloat)的解决方案。 该智能体充当“资深 DBA”的角色,通过 20 个后台作业持续监控数据库,以主动解决性能瓶颈。主要功能包括: * **优化:** 自动化处理慢查询并防止模式膨胀。 * **BI 与访问:** 生成仪表板以替代 Tableau 等第三方工具,并对个人身份信息(PII)进行脱敏,以实现安全的数据访问。 * **集成:** 提供一个“大脑”,通过 MCP 与命令行界面、Slack、Web UI 以及集成开发环境(如 Cursor/Claude)进行交互。 * **自托管:** 使用内置存储层(Postgres 和 PGVector)来维护上下文。 DeepSQL 的目标并非取代人类 DBA,而是通过自动化日常维护并提供专家级的数据库健康洞察来赋能工程师。该工具可通过一行安装脚本进行部署,目前已开放以供社区反馈和集成。

关于 新闻 版权 联系我们 创作者 广告 开发者 条款 隐私 政策与安全 YouTube 的运作方式 测试新功能 © 2026 Google LLC

这篇 Hacker News 的讨论围绕一段关于 1675 年“机械灯泡”的视频展开。用户们回顾了电力技术的飞速演变,从本杰明·富兰克林的早期实验一直追溯到现代的太空探索。 主要内容包括: * **历史起源:** 贡献者指出,富兰克林根据炮兵术语创造了“电池”(battery)一词,并确立了电的正负极惯例,尽管他当时并没有电子流动的概念。 * **早期创新:** 讨论提到了“富兰克林铃”,作为将电能转化为机械能的早期原始实例。 * **技术进步:** 参与者惊叹于 18 世纪实验与现代空间望远镜等先进技术之间的跨越,并推测未来 300 年可能带来的变化。 * **背景细微差别:** 该帖还探讨了富兰克林遗产的复杂性,在承认其科学才华的同时,也指出了他作为奴隶主与后来成为废奴主义者这一立场之间的伦理矛盾。 总而言之,这段对话反映了早期那些渐进且往往粗糙的发现,是如何为当今复杂的科技世界铺平道路的。

更多

联系我们 contact @ memedata.com