截至2025年1月15日,全球已索引的万维网页面估计约为39.8亿个,其中荷兰语索引部分总计20.4亿个。然而,由于谷歌限制了自动数据检索,使得继续计算这些数据成为不可能,因此此类估算工作已经停止。 从历史上看,这些估算值是通过词频外推法得出的。研究人员每天向搜索引擎发送50个随机抽取的词汇,并将搜索结果与代表性的背景语料库(DMOZ)进行比对,从而估算每个引擎的索引规模。为了得出整个网络的总估算值,研究人员会将各搜索引擎之间的重叠部分从其各自索引的总和中扣除。 该项目起源于蒂尔堡大学的一篇硕士论文,后发表于《科学计量学》(Scientometrics,2016年)。此前,在雅虎(Yahoo)和Ask.com停止报告总结果数后,该项目已停止对这两者的测量。尽管该方法仍有学术记录,但由于目前持续存在的数据访问障碍,该项目已无法提供实时更新。
**Shoehorn** 是一款旨在通过将语言模型精确适配至特定硬件内存,从而最大化其性能的工具。与通常会浪费容量或导致加载失败的标准预设量化不同,Shoehorn 会在扣除开销后计算出确切的可用内存,并分配逐张量(per-tensor)的混合精度,以利用高达 99.99% 的预算空间。
主要功能包括:
* **自定义优化:** 精确到字节,为您特定的 VRAM 或 RAM 计算出质量最高的适配方案。
* **基于浏览器的搜索:** 一个网页工具,可扫描 Hugging Face 上与您的硬件和预期上下文长度(例如 4k 到 32k token)兼容的模型。
* **无缝集成:** 使用 Rust 构建,可生成与 `llama.cpp` 生态系统兼容的标准 GGUF v3 文件。
* **易于使用:** 安装简单,本地网页界面提供预算的“卷尺”可视化效果及一键“聊天”按钮。
Shoehorn 消除了模型量化过程中的猜测,确保您能获得机器实际运行能力范围内最强大的模型。该工具为开源(MIT 许可证),可通过 Homebrew 或 Cargo 获取。
这篇文章认为 OpenAI 是一家经济上不可持续且必然面临清算的公司。作者指出,OpenAI 的商业模式从根本上是失败的:它在巨额且不断攀升的亏损中运营,并依赖于“安然式”的会计手法和具有误导性的“年度营收”指标,以掩盖其增长全靠不可持续的算力支出支撑这一事实。
论点核心在于,OpenAI 到 2030 年已承诺超过 8000 亿美元的算力支出,却找不到盈利路径。随着面临类似问题的 Anthropic 等竞争对手不断涌现,OpenAI 被困在永无止境且融资难度日益加大的恶性循环中。作者认为,OpenAI 对微软、亚马逊和英伟达等超大规模云厂商资本的依赖,创造了一种“虚假”营收的循环经济——这些公司资助 OpenAI,仅仅是为了确保它购买自家的云服务。
作者警告称,人工智能泡沫正临近破裂点。如果 OpenAI 崩溃,将引发一场波及软银等主要投资者,以及甲骨文、微软和谷歌等超大规模云厂商的系统性危机。文章最后呼吁记者和投资者停止为人工智能炒作制造共识,并为这一不可持续商业模式的必然崩溃做好准备。
发布于:2026年8月17日
与 Hacker News 头版上的那位疯子形成鲜明对比:我是如何过度设计我的书的。
我将每一章的初稿都打在 Obsidian 里,然后复制粘贴到 Word 中。完成后,将其拖放到 Box 中,那是 Manning 存储作者文稿的地方。然后我一直重复这个过程,直到全部完成。它看起来就像这样:
完成了!在这里购买!把钱给我!