每日HackerNews RSS

该实验表明,为 27B 模型(Qwen3.8)在 262K token 上下文下构建最佳本地推理系统,需要采取整体方案,而非仅仅挑选“同类最佳”的单一组件。 作者使用 NVIDIA RTX PRO 4000 (Blackwell) 和 RTX 2000 Ada,成功在 24GB 显存内平衡了密集模型、多模态投影器和 MTP 推测解码。主要发现包括: * **量化策略:** 采用原生 NVFP4 处理大部分权重,并对敏感张量使用 Q5/Q6 的自定义 5.01 BPW 混合量化,其质量和吞吐量均优于标准量化方案。 * **MTP 校准:** “最佳”草稿模型(drafter)并非精度最高的那个,而是与目标量化模型最兼容的那个。提高草稿模型精度反而因接受率降低导致吞吐量下降了 26.6%。 * **内核优化:** 通过自定义 `llama.cpp` 构建(引入 Gated DeltaNet、Flash Attention 混排以及特定的 CUDA 图优化),性能较主分支提升了 21.97%。 * **基准测试:** 真正的性能必须在缓存填满的“远端”(12.61 tok/s)进行测量,而非在起始阶段。 该系统在生产环境达到 50.44 tok/s,证明了硬件感知量化与内核对齐的性能表现优于规模更大但优化不足的模型。

Hacker News 最新 | 过往 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 在 24GB RTX PRO 4000 SFF (432 GB/s) 上运行 256K 上下文的 Qwen3.8-27B:通过 MTP 实现 50 tok/s (piszczek.pl) 10 分,pich 发布于 1 小时前 | 隐藏 | 过往 | 收藏 | 2 条评论 帮助 supermatt 13 分钟前 | 下一条 [–] 能否请你测试一下在某种并发处理下能达到多少 tokens?我见过的所有针对入门级显卡的基准测试几乎都只是单请求。 回复 nubg 6 分钟前 | 上一条 | 下一条 [–] 量化级别是多少? 回复 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系 搜索:

Turbopuffer 在公共 SaaS、单租户以及 BYOC(自携云环境)中运行着超过 100 个数据库集群。为了在不侵入客户基础设施的前提下管理这些集群,他们构建了一套健壮的、基于 Agent 的控制平面。 Turbopuffer 没有使用 Terraform 等传统 IaC 工具(这些工具不适合即时数据库运维),而是在每个集群上运行一个**本地 Kubernetes Agent**。该 Agent 由单个自定义资源(CRD)驱动,执行状态机逻辑。Agent 通过轮询中央 API 获取任务并在本地处理操作,即便与控制平面的连接中断,也能确保系统稳定性。 主要特性包括: * **操作解耦:** 控制平面通过基于 MySQL 的 API 维护状态,而本地集群负责执行并报告状态转换,确保集群自身始终是事实来源。 * **键盘驱动的 UI:** 工程师通过一个受 Linear 启发、响应迅速的自定义仪表盘来管理整个集群群组。 * **集群自动化:** 控制器以分批次的方式管理大规模部署,并能在触发监控报警时自动暂停。 * **集成可观测性:** 与日志、指标及 Slack 告警的无缝连接,简化了故障排查流程。 这种简洁统一的架构使 Turbopuffer 能够在多样化的云环境中扩展的同时,保持快速的部署速度。

Hacker News 最新 | 过往 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 如何每天交付一个数据库 (turbopuffer.com) 12 分 | tarunnnp 发布于 1 小时前 | 隐藏 | 过往 | 收藏 | 讨论 | 帮助 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系 搜索:

本文详细介绍了“Plush”的性能优化过程。Plush 是一门采用 Actor 架构的玩具编程语言。 最初,作者实现了一种依赖 `HashMap` 来追踪对象转发的复制式垃圾回收器(GC),旨在简化 Actor 之间的消息传递。然而,由于哈希映射带来的高内存开销、不可预测的缓存访问模式以及 Rust 中安全哈希计算的性能成本,该设计效率低下。GC 未能达到 20 毫秒内回收一百万个对象的目标,实际耗时为 117 毫秒。 通过将 `HashMap` 替换为使用转发指针的经典 Cheney 算法,GC 性能提升至 7 毫秒,超出了预期目标。为了进一步提高效率,作者利用 `mmap` 技术动态扩展内存缓冲区,且无需重置指针,从而解决了此前在消息大小和协调方面的限制。 这些改进显著提升了 Plush 的性能和内存效率。作者总结道,尽管哈希映射等现代数据结构非常有用,但在高性能内存管理方面,指针转发等底层技术仍然更胜一筹,这证明了经典算法在系统设计中具有持久的价值。

Hacker News | 往日 | 评论 | 提问 | 展示 | 工作 | 投稿 | 登录 加速 Plush 垃圾回收器 (pointersgonewild.com) 5 分 | maxime_cb 发布于 1 小时前 | 隐藏 | 往日 | 收藏 | 讨论 | 帮助 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 加入 YC | 联系 搜索:

**Foreman** 是一款人工智能驱动的软件工厂,旨在实现端到端开发循环的自动化,让开发人员能够专注于高层决策。它直接与 GitHub 和 Linear 集成,利用四个专业的 AI 代理来处理任务的全生命周期: 1. **分类器 (Classifier):** 任务分拣与验证。 2. **分析师 (Analyst):** 规划任务并定义验收标准。 3. **执行者 (Implementer):** 在隔离沙盒中进行代码编写。 4. **审核员 (Reviewer):** 独立进行验证。 Foreman 维护一个“工厂大脑”来存储特定于仓库的知识,确保上下文在不同任务间得以保留。该系统具有高度互动性,可通过问题标签、@提及或本地 TUI 触发。当分配任务后,Foreman 会执行流水线、发布进度更新并提交一份经过审核的拉取请求草稿。它甚至能自行处理 CI 故障,并为人工审核人员提供导向摘要。 Foreman 专为通过 Vercel 进行无缝部署而设计,支持自定义设置命令和环境变量配置,以匹配您仓库的具体需求。通过在自动化繁琐工作的同时要求人工审批代码变更,Foreman 在不牺牲质量或监督的前提下,精简了开发流程。

Hacker News最新 | 过往 | 评论 | 提问 | 展示 | 招聘 | 提交登录Show HN: Eve 软件工厂 (github.com/vercel-labs)3 分,作者:flashbrew,36 分钟前 | 隐藏 | 过往 | 收藏 | 讨论使用此免费开源模板,几分钟内即可构建软件工厂 帮助 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系 搜索:

正在检查您的浏览器...需要启用 JavaScript

Hacker News 新内容 | 过往 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 如何将 170 个原子放入一个原子中 (signoregalilei.com) 10 分,由 surprisetalk 发布于 42 分钟前 | 隐藏 | 过往 | 收藏 | 讨论 帮助 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 申请 YC | 联系 搜索:

如果您对科技环境中的侵入式 AI 功能感到困扰,通常可以通过特定设置将其禁用或限制。本指南为您提供了在常用平台上移除或关闭 AI 的路径: * **浏览器:** 使用浏览器标志(如 `chrome://flags` 或 `edge://flags`)禁用 Gemini 或 Copilot 等 AI 组件。Firefox 提供内置的“AI 控制”功能以阻止相关增强。 * **操作系统:** 在 Windows 11 上,您可以在任务栏和记事本设置中卸载或关闭 Copilot。对于 macOS/iOS,可以通过系统设置禁用 Apple Intelligence。 * **应用与服务:** 许多工具允许您选择退出 AI 驱动的功能: * **Adobe:** 在偏好设置中禁用生成式 AI。 * **Google Workspace:** 在 Gmail 和文档设置中关闭“智能功能”。 * **通讯应用:** 在 Slack、WhatsApp 和 Zoom 的设置菜单中管理 AI 摘要和回复功能。 * **Android:** 使用系统设置禁用 Gemini,或将其从电源键唤醒中移除。 如需了解跨设备和软件管理这些设置的详细分步说明,请访问完整指南:**[https://NoToAI.org](https://NoToAI.org)**。

最近的一场 Hacker News 讨论凸显了用户对于行业内强行在软件中植入侵入式 AI 功能的普遍不满。参与者们表示,公司将昂贵且不受欢迎的 AI 集成置于用户体验之上,令他们感到厌烦,并指出这些工具正变得越来越难以避开。 该讨论帖探讨了这种“AI 优先”策略背后的动机,一些用户推测,公司是有意让这些功能无处不在,以确保持久的依赖性。另一些人则讨论了重获浏览体验的实际方法,例如使用特定的 URL 参数(如 Google 的 `udm=14`)来绕过 AI 生成的搜索摘要。最终,舆论一致表现出对当前充斥数字空间的“AI 垃圾内容”的疲惫,用户不得不投入大量的时间和精力去抵御这些他们从未要求过的功能。

Wiz Research 的自主“红队代理”(Red Agent)近期在 Snowflake 的一个 GitHub 代码库中发现并成功利用了一个关键的工作流注入漏洞。该漏洞允许未经身份验证的用户执行任意命令,是 GitHub Copilot Autofix 无意中引入的。该人工智能助手将一种安全的、专注于过滤的代码模式替换为了存在漏洞的直接字符串插值,凸显了 AI 编程工具可能绕过既定安全措施的问题。 在发现漏洞后,Wiz 的 AI 代理自主优化了漏洞利用载荷以避开 Bash 语法错误,并成功窃取了内部 Jira 凭据。Wiz 于 2026 年 6 月 23 日通过 Snowflake 的 HackerOne 项目负责任地披露了这一发现。Snowflake 对该漏洞进行了修复,重置了受影响的凭据,并确认在五天的暴露窗口期内没有第三方参与者利用过该漏洞。 此事件突显了行业内的两个关键转变:一是 AI 生成代码引发回归的风险,即自动化工具缺乏保持安全最佳实践的背景知识;二是随着安全工具日益自动化,“发现窗口”正在不断缩短。建议各组织对 AI 编写的代码进行与人类贡献代码同等严格的安全审查,并建立防护机制,防止结构化数据解析器被不安全的 Shell 命令插值所取代。

Wiz 最近的一份报告显示,GitHub Copilot AI 自动生成的“自动修复”代码引发了安全漏洞,最终导致 Snowflake 内部的 Jira 系统遭到未经授权的访问。 此事件在 Hacker News 上引发了关于过度依赖 AI 辅助编程工具风险的讨论。用户强调,尽管 AI 能加速开发进程,但并不能取代严谨的同行评审。评论者指出,如果缺乏对内部系统的深层了解,人工评审员可能难以识别自动化建议中潜藏的安全隐患。 为了降低这些风险,社区建议实施自动化安全检查(如代码检查工具和注入扫描器),并采用多模型交叉评审,以捕捉人工或 AI 评审员可能遗漏的细微缺陷。归根结底,此次入侵事件提醒我们,必须像对待人工编写的代码一样,对 AI 生成的代码进行同等水平的审查和测试。

DuckDB v2.0 代号“Cyanoptera”,计划于今年秋季发布。这是该项目历史上最重要的更新,自 v1.5 版本以来已累计超过 10,000 次提交。 **主要亮点包括:** * **服务器模式:** “quack”协议趋于成熟,使 DuckDB 能够作为客户端/服务器数据库运行。新增的 `CONNECT` 命令支持原生网络通信,以及向 PostgreSQL 和 MySQL 进行远程 SQL 推送。 * **性能与存储:** 引擎现已支持异步 I/O 以实现更快的网络存储访问;引入了具备缓冲管理索引的新存储格式,支持即时加载;并进行了重大的查询优化(例如递归 CTE 速度提升 40 倍)。 * **新功能:** 备受期待的 SQL 触发器、用于半结构化数据的高性能 `VARIANT` 类型,以及改进的可观测性工具。 * **可扩展性:** 基于 PEG 的全新可扩展 SQL 解析器,以及现代化且稳定的 C API,确保了扩展程序在未来版本中的兼容性。用户现在还可以托管并签署自己的自定义扩展仓库。 * **开发体验:** 增强的 SQL 语法,包括嵌套架构(Nested Schemas)、CTE 中的 DML 操作,以及改进的兼容模式。 为了实现这些基础性改进,DuckDB v2.0 引入了一些必要的破坏性变更,主要涉及默认存储格式。

Hacker News 新内容 | 过往 | 评论 | 提问 | 展示 | 招聘 | 提交 登录 DuckDB v2.0 预览版 (duckdb.org) 50 点,由 ibotty 发布于 1 小时前 | 隐藏 | 过往 | 收藏 | 1 条评论 帮助 c9cf35860db4 6 分钟前 [–] 过去一年 DuckDB 的改进感觉就像是从进程内执行引擎(这是它极其擅长的领域)向可以作为云数据仓库基础的引擎转变。我知道创始人们曾经很抗拒构建云数据仓库,但我有一种预感,这已经在筹划中了。回复 指南 | 常见问题 | 列表 | API | 安全 | 法律 | 加入 YC | 联系 搜索:

德国竞争监管机构联邦卡特尔局(Bundeskartellamt)已结束了对苹果公司“App 追踪透明度框架”(ATTF)长达数年的调查。监管机构此前主张,苹果公司对其自身服务施加的许可要求比第三方应用更为宽松,以此滥用市场支配地位;这种做法实质上阻碍了用户同意第三方追踪,从而偏袒了苹果自身的生态系统。 为了解决调查,苹果承诺将使其所有平台上的许可提示更加统一。该公司将重新设计这些提示,确保在布局、措辞和内容上保持中立,删除此前阻碍用户选择参与第三方追踪的元素。此外,苹果将简化其架构,给予应用发布者更多灵活性,以便将其隐私法披露信息与 ATTF 的要求相结合。 此项和解确保了苹果无法利用其“守门人”地位获取不公平的竞争优势,转而营造一个让用户能够针对个人数据做出中立且知情决策的环境。这些承诺的有效期为七年,并将由独立监督员进行监督,这是欧洲旨在监管大型数字平台数据共享行为的广泛举措的一部分。

德国竞争监管机构“联邦卡特尔局”(Bundeskartellamt)裁定,苹果公司必须使其自研应用的“App 追踪透明度”(ATT)许可提示,与目前对第三方开发者要求的更严格标准保持一致。 该裁决旨在解决苹果作为平台所有者和应用提供商的“双重角色”问题。此前,苹果一直能够绕过其施加给竞争对手的同类数据追踪限制。尽管监管机构推动这一变革是为了确保公平竞争,但该决定在 Hacker News 上引发了争议。 一些用户认为此举是迈向透明度的一大步,而另一些人则对其执行方式表示批评。批评者认为,苹果本应提高自身标准以最大程度保护用户,而不是通过降低第三方隐私门槛来与苹果匹配。此外,一些评论者指出,苹果仍然保留了对某些系统级 API 的独占访问权,这使得竞争环境依然不公平。归根结底,这场讨论反映了政府在强制执行市场中立性与用户对所有系统应用享有高隐私标准之间的矛盾。

404 Media 的一项调查证实,亚马逊正在大量购入纸质书用于训练其人工智能模型,并在此过程中销毁这些实体书。调查人员通过 AirTag 追踪货物,将书籍的去向锁定在了位于拉斯维加斯的一个名为“VGT3”的亚马逊专业设施中。 该站点的员工证实,他们的主要工作是切开书脊,以便进行高速扫描并录入数字化系统。这一操作与独立书商的反馈相吻合——书商们发现,近期针对 2022 年以前出版书籍的大批量、不计价格的订单异常激增。人工智能公司非常看重这些旧书,因为它们包含独特的、由人类创作的内容,这些内容在互联网上难以获取,且不存在被人工智能生成内容污染而导致“模型崩溃”的风险。 尽管亚马逊声称购书是为了改进其产品和服务,但这一行为凸显了人工智能训练过程的激进与资源密集型本质。批评人士指出,这一过程抛弃了实体书的历史、智力与情感价值,将复杂的人类著作仅仅简化为大语言模型的数据点。

一份来自《404 Media》的报道揭露了一批“稀有书籍”被追踪至亚马逊的一个人工智能训练设施,这一消息在 Hacker News 上引发了激烈讨论。该媒体通过在包裹中放置 AirTag,追踪到这批书籍被送往一处设施,极有可能正被破坏性扫描以用于人工智能训练。 评论区对此报道观点分歧明显。批评《404 Media》的人士认为该文章是在“博取愤怒”,并指出“稀有”一词定义模糊,可能指代任何事物,从历史文物到注定要进造纸厂的晦涩自出版手册均在其中。许多人认为,销毁不再需要的书籍是一种标准的、并无恶意的物流做法。 相反,另一些人则将此行为视为人类知识被令人担忧地集中化,并将这种大规模吞噬知识产权的行为标记为“不道德”或“盗版”。虽然一些用户哀叹实体书的销毁,但另一些人则认为真正的反派并非亚马逊,而是过时的版权法,这些法律阻碍了文本的数字化和公开保存。总而言之,这场讨论反映了人们对人工智能数据获取伦理,与实体书不可避免地走向过时这一现实之间更深层的焦虑。

更多

联系我们 contact @ memedata.com