Horizon · 2026-09-01
每日速递
每日速递 - 2026-09-01
从 61 条内容中筛选出 11 条重要资讯。
- 谷歌从 Chrome 网上应用店移除 MV2 扩展,包括 uBlock Origin ⭐️ 8.0/10
- 丹·艾瑞里拖延症研究被证实存在数据造假 ⭐️ 8.0/10
- 41 年《危险边缘》知识压缩进 9GB 本地模型 ⭐️ 8.0/10
- 将 Rasch 测量理论应用于 LLM 评估 ⭐️ 8.0/10
- 量化触发的大语言模型后门:新型攻击向量 ⭐️ 8.0/10
- 用 HNSW 向量索引替代稠密输出投影加速 LLM 推理 ⭐️ 8.0/10
- Darling:在 Linux 上运行 macOS 软件 ⭐️ 7.0/10
- 用 BirdNET-Go 将安防摄像头变成自动鸟类识别系统 ⭐️ 7.0/10
- Wrapture:用于追踪和测试的新 Python 库 ⭐️ 7.0/10
- Playa Phone:火人节互动电话亭连接陌生人 ⭐️ 6.0/10
- 单个 HTML 文件中的可步行 ASCII 赛博朋克城市 ⭐️ 6.0/10
谷歌从 Chrome 网上应用店移除 MV2 扩展,包括 uBlock Origin ⭐️ 8.0/10
谷歌已从 Chrome 网上应用店移除所有 Manifest V2(MV2)扩展,包括流行的广告拦截器 uBlock Origin。这标志着向 Manifest V3(MV3)过渡的最后阶段,该过渡始于多年前。 这影响了数百万依赖 uBlock Origin 进行有效广告拦截和隐私保护的 Chrome 用户。它凸显了谷歌对浏览器生态系统的控制,并促使用户考虑 Firefox 等仍支持 MV2 扩展的替代方案。 MV3 通过限制阻止网络请求的使用来限制广告拦截器,迫使 uBlock Origin 提供效果较差的“精简版”。此次移除是分阶段弃用的一部分;最后一个 MV2 重新启用标志计划在 Chrome 151 中删除,该版本将于 2026 年 7 月 28 日达到稳定版。
hackernews · twapi · 8月31日 21:10 · 社区讨论
背景: Manifest V2 是 Chrome 之前的扩展平台,允许 uBlock Origin 等扩展通过拦截网络请求来阻止广告。谷歌引入 Manifest V3 是为了提高安全性和性能,但也限制了广告拦截功能。这一过渡一直存在争议,批评者认为它服务于谷歌的广告利益,而非用户隐私。
参考链接:
- Migrate to Manifest V3 | Chrome for Developers
- Manifest V2 vs Manifest V3 (Chrome Extensions): What Changed, and Why 2025 Was the Turning Point | by mossab | Medium
- Manifest V2 vs V3: What Actually Dies in August 2026
社区讨论: 评论者对谷歌的决定表示不满,许多人推荐 Firefox 作为更好的广告拦截替代方案。一些人强调广告拦截是一个安全问题,尤其是对不太懂技术的用户,并批评谷歌没有解决恶意广告问题。其他人指出 uBlock Origin 在 Firefox 中一直表现最佳。
标签: #Chrome, #Manifest V2, #uBlock Origin, #ad-blocking, #browser privacy
丹·艾瑞里拖延症研究被证实存在数据造假 ⭐️ 8.0/10
一项由丹·艾瑞里合著的有影响力的拖延症研究被发现包含伪造数据,这一发现详细记录在 DataColada 的新分析中。这进一步增加了围绕艾瑞里研究的诚信问题。 此案例凸显了科学界,尤其是行为科学领域持续存在的复制危机,并引发了对广泛引用研究可靠性的严重担忧。它还强调了加强验证实践和对研究不端行为追责的必要性。 涉事研究很可能是 2014 年关于自我设定截止日期的论文,该论文被广泛引用。伪造数据似乎涉及捏造的回应,分析提供了篡改的统计证据。
hackernews · Anon84 · 8月31日 23:45 · 社区讨论
背景: 丹·艾瑞里是著名行为科学家,著有《怪诞行为学》等畅销书。复制危机指的是越来越多科学发现无法在独立测试中复现,从而引发对其有效性的质疑。DataColada 是一个调查研究诚信问题的博客,经常揭露数据造假行为。
社区讨论: 评论者对如此长时间的欺诈未被发现表示震惊,有人呼吁在引用前必须进行复制。其他人则提到艾瑞里的争议历史,并质疑杜克大学为何仍与他保持联系。还有讨论涉及截止日期的实际影响以及为复制研究提供更好激励的必要性。
标签: #research integrity, #replication crisis, #scientific fraud, #procrastination, #behavioral science
41 年《危险边缘》知识压缩进 9GB 本地模型 ⭐️ 8.0/10
研究人员使用一个 9GB 的开源权重模型(Qwen2.5-14B,4 位量化)对完整的《危险边缘》题目数据集进行了评估,该数据集包含 529,939 道题目,跨越 41 个赛季(1984-2025),在严格的强制回答协议下达到了 67.0%的准确率。这是首次有模型在完整语料库上运行。 这表明一个便携、免费的模型能够封装人类知识的广泛快照,而此前只有像 IBM Watson 这样的庞大基础设施才能实现。这为可访问的 AI 知识系统打开了大门,这些系统可以被密封在时间胶囊中并在本地运行。 该模型在事实类别的准确率超过 85%,在训练截止日期之后播出的题目上保持 65%的准确率,而 Claude Opus 4.8 达到 95%,Watson 则因设计原因得分为零。作者将训练数据暴露视为共同特征,并指出 Watson 的语料库是专门为包含《危险边缘》答案而策划的,并针对过去的题目进行了调优。
rss · arXiv cs.AI · 8月31日 04:00
背景: IBM Watson 的 DeepQA 系统在 2011 年击败了《危险边缘》的人类冠军,但其知识被冻结在一个经过策划的十亿文档语料库中,运行在 POWER7 服务器上,无法移动或复制。像 Qwen2.5-14B 这样的开源权重模型,在量化为 4 位后,可以在消费级硬件上运行,同时保留广泛的知识。《危险边缘》题目数据集是一个开放资源,包含超过五十万道带有已验证答案的题目,使其成为通用知识的基准。
参考链接:
- IBM Watson - Wikipedia
- Artificial Intelligence > Watson’s DeepQA Architecture …
- Time Capsule of Testable Human Knowledge: 41 Years of Jeopardy! in a Single Free Local Model
标签: #AI, #NLP, #Open-Weight Models, #Knowledge Representation, #Benchmarking
将 Rasch 测量理论应用于 LLM 评估 ⭐️ 8.0/10
本文引入 Rasch 测量理论(RMT)来分解 LLM 评估评分,识别评分者偏差并提高测量效度。一项基于 Measuring Hate Speech 语料库的 LLM-as-rater 范式案例研究揭示了 LLM 与人类评分者之间的系统性差异。 这项工作填补了 LLM 评估中理解评分者偏差和测量效度的关键空白,对于改进基准设计和 LLM-as-judge 实践至关重要。它提供了一个严谨的框架,有望提高各种范式中 AI 评估的可靠性。 该研究对来自九个不同家族和能力水平的 LLM 的标注拟合了一系列多面 Rasch 模型。研究发现,LLM 在严重性、项目级校准、问题顺序稳健性、目标身份敏感性和评分量表使用方面与人类评分者存在系统性差异,而这些差异在标准评估实践中会被掩盖。
rss · arXiv cs.AI · 8月31日 04:00
背景: Rasch 测量理论(RMT)是一种心理测量框架,将响应的概率建模为个人能力和项目难度的函数,为成功测量提供了标准。多面 Rasch 模型扩展了这一框架,纳入评分者严重性等额外方面,从而能够分离和校准对评分的多种影响。在 LLM 评估中,LLM 被用作受试者、评委和评分者,每一种都可以被视为一个测量问题,其中潜在属性由评分者用项目进行探测。
参考链接:
- Rasch model - Wikipedia
- Chapter 7 Many Facet Rasch Model | Rasch Measurement Theory Analysis in R: Illustrations and Practical Guidance for Researchers and Practitioners
- [2608.27463] Rating the Raters: Rasch Measurement Theory for LLM Evaluation
标签: #LLM evaluation, #Rasch measurement theory, #rater bias, #measurement theory, #AI safety
量化触发的大语言模型后门:新型攻击向量 ⭐️ 8.0/10
本文正式提出了量化大语言模型中的验证-部署差距,证明量化可以触发隐藏后门,从而绕过源精度安全检查。研究在多语言编码器-解码器模型上展示了攻击,在 INT8 或 4 位压缩后,翻译任务的反转率高达 85.02%,立场分类的意识形态偏移达ΔBias=0.33。 这项工作揭示了 LLM 部署流程中的一个关键安全漏洞,即模型在全精度下通过安全检查,但在量化后变得恶意。它强调了在行为认证中纳入最终部署配置的必要性,影响了边缘部署的 AI 安全实践。 论文引入了量化行为等价类(QBECs),并证明其成员关系并不蕴含行为等价性。攻击在战术机器翻译和政治内容分析两个场景中进行了评估,将先前的工作从仅解码器模型扩展到编码器-解码器架构。跨量化器的可迁移性因方案和架构而异,而不仅仅取决于位宽。
rss · arXiv cs.LG · 8月31日 04:00
背景: 训练后量化(PTQ)是一种常见的压缩 LLM 以用于边缘部署的技术,通常在全精度评估后应用而不重新测试。后门攻击会嵌入由特定输入触发的恶意行为,先前的研究主要关注文本分类或仅解码器模型。本文填补了编码器-解码器模型以及量化与后门交互方面的空白。
参考链接:
- [2608.27512] Quantization-Triggered Backdoors in Language Models: Cross-Quantizer Transferability and the Validation–Deployment Gap
- Quantization-Triggered Backdoors in Language Models: Cross-Quantizer Transferability and the Validation–Deployment Gap
- Optimizing LLMs for Performance and Accuracy with Post-Training Quantization | NVIDIA Technical Blog
标签: #LLM security, #quantization, #backdoor attacks, #AI safety, #adversarial machine learning
用 HNSW 向量索引替代稠密输出投影加速 LLM 推理 ⭐️ 8.0/10
本文提出用基于 HNSW 的向量索引替代 LLM 中的稠密输出嵌入投影,在 CPU 上为 Gemma 3、Llama 3.2 和 Qwen 3 等模型实现了高达 82%的吞吐量提升。 该方法解决了自回归解码中的关键内存带宽瓶颈,尤其适用于词汇量大的紧凑型 LLM。它为延迟敏感的小批量推理提供了一种实用的加速方式,且不牺牲质量,对边缘和实时应用具有重要意义。 输出头仅检索少量高分 token 候选集,并通过将检索到的 logits 散布到稀疏的全词汇张量中集成到现有流水线。在 CPU 推理中,对于 Gemma 3 270M,端到端 batch-size-one 解码吞吐量提升高达 82%,同时在 AlpacaEval 评估下保持生成质量。
rss · arXiv cs.CL · 8月31日 04:00
背景: 大型输出嵌入矩阵在自回归解码过程中造成显著的内存带宽瓶颈,尤其对于词汇量大的紧凑型 LLM。本文将输出投影及随后的 top-k token 选择重新表述为对 token 嵌入的最大内积搜索(MIPS),并用基于 HNSW 的向量索引替代稠密词汇投影。HNSW 是一种流行的近似最近邻搜索算法,通过构建层次图实现高效检索;MIPS 是机器学习中寻找与查询内积最大项的基本问题。
参考链接:
- Hierarchical Navigable Small Worlds ( HNSW ) | Pinecone
- Maximum inner-product search
- Vector Database Basics: HNSW | Tiger Data
标签: #LLM inference, #vector search, #HNSW, #output embeddings, #performance optimization
Darling:在 Linux 上运行 macOS 软件 ⭐️ 7.0/10
Darling,一个开源兼容层,无需硬件模拟即可在 Linux 上运行 macOS 软件,目前仅支持 x86_64 架构。该项目仍在活跃开发中,但更新频率有限,社区讨论中也提到了这一点。 该项目为在 Linux 上运行 macOS 应用提供了一种轻量级替代方案,可能使需要特定 macOS 工具的开发者和用户受益,而无需使用完整的虚拟机。在跨平台兼容层的更广泛生态中,它代表了一种小众但有价值的解决方案,类似于 Wine 对 Windows 应用的支持。 Darling 基于苹果开源的 Darwin 代码,并使用 The Cocotron 和 Apportable Foundation 来实现 Cocoa 框架。它支持 DPREFIX(类似于 WINEPREFIX),但需要 overlayfs,因此无法在 NFS 或 eCryptfs 等文件系统上工作,也不支持加密的主目录。
hackernews · Bluestein · 8月31日 22:53 · 社区讨论
背景: Darling 是一个免费开源的 macOS 兼容层,类似于 Wine,它将 macOS 系统调用转换为 Linux 等效调用,使未修改的 macOS 二进制文件能在 Linux 上原生运行。它旨在将 macOS 应用集成到 Linux 桌面环境中,使其看起来和感觉像原生 Linux 应用。目前,它主要支持 x86_64 架构,且大多数 GUI 应用尚无法运行。
参考链接:
- Darling (software) - Wikipedia
- Darling | macOS translation layer for Linux
- GitHub - darlinghq/darling: Darwin/macOS emulation layer for … How to Run macOS Apps on Linux with Darling (What Actually … CynicalWilson/macOS_emu: Darling - GitHub Run MacOS Software On Linux Using Darling - OSTechNix Darling (software) - Wikipedia Darling download | SourceForge.net
社区讨论: 社区评论对在 ARM64 Linux 上运行 Apple Silicon 应用表示兴趣,但指出 Darling 仅支持 x86_64 且更新很少。一位用户分享了一个相关项目,尝试在 macOS 上运行 Linux 二进制文件,并强调了寄存器差异等技术挑战。另一位评论者赞赏该项目使用了 The Cocotron 和 Apportable 等现有开源组件。
标签: #macOS, #Linux, #compatibility layer, #open-source, #Darling
用 BirdNET-Go 将安防摄像头变成自动鸟类识别系统 ⭐️ 7.0/10
Jason Tucker 的一篇博客文章详细介绍了如何利用 BirdNET-Go(一个自托管的 AI 声景分析器)将安防摄像头改造成自动鸟类识别系统。该帖子获得了大量社区关注,获得了 364 个点赞和 94 条评论。 该项目展示了 AI 在野生动物监测中的实用、低成本应用,使鸟类识别对爱好者和研究人员变得触手可及。它凸显了 BirdNET-Go 的多功能性,并鼓励创客社区进行 DIY 创新。 BirdNET-Go 可在树莓派上全天候运行,利用多模型本地 AI 推理,通过 RTSP 流分析来自安防摄像头的音频。该系统可与 Home Assistant 集成,用于警报和通知,相关项目已展示了这一点。
hackernews · speckx · 8月31日 16:47 · 社区讨论
背景: BirdNET 是康奈尔鸟类学实验室开发的 AI 声音识别工具,能够从音频录音中识别鸟类物种。BirdNET-Go 是其自托管版本,可在树莓派等设备上本地运行,实现无需云端的实时分析。带有麦克风的安防摄像头可以提供连续的音频流,可用于野生动物监测。
参考链接:
- GitHub - tphakala/birdnet-go: Self-hosted realtime soundscape analyser for birds, bats and other wildlife. Multi-model local AI inference, runs 24/7 on a Raspberry Pi. · GitHub
- BirdNET – AI-Powered Sound ID
- Backyard Bird Tracking With AI-Powered BirdNET-Go
社区讨论: 社区成员分享了他们自己的实现,例如使用 Unifi 门铃摄像头和 Aqara 摄像头,并提供了克服硬件限制的技巧,如麦克风质量差和采样率问题。一些人称赞 Merlin Bird ID 应用作为替代方案,而另一些人则讨论了 markdown 卡片中 ASCII 块渲染等技术细节。
标签: #BirdNET, #bird identification, #security cameras, #DIY, #audio processing
Wrapture:用于追踪和测试的新 Python 库 ⭐️ 7.0/10
Graham Dumpleton 推出了 Wrapture,这是一个 Python 库,扩展了 wrapt 的 monkeypatching 思想,使得对函数/方法访问的追踪和覆盖用于测试和观察成为可能。该项目只有几周大,包含 OpenTelemetry 支持和基于配置的追踪机制。 Wrapture 为 unittest.mock 提供了一个潜在的替代方案,并为现有项目添加追踪而不修改代码提供了一种方式,这可能使 Python 开发者在测试和可观测性方面受益。它也是一个显著的 AI 辅助开发项目示例,作者精心设计,AI 作为生产手段。 Wrapture 允许包装任何函数或方法以追踪所有访问或覆盖返回值,并支持基于配置的追踪添加方式,如 TOML 示例所示。该项目非常年轻,只有几周大,是 Graham 第一个完全由代理驱动的大型项目,所有代码和文档均由 AI 助手在他的指导下编写。
rss · Simon Willison · 8月31日 23:59
背景: Wrapt 是一个用于装饰器、包装器和 monkey patching 的 Python 模块,为构造函数包装器提供了透明的对象代理。Monkeypatching 是一种在运行时修改或扩展代码的技术,常用于测试中替换或桩掉系统的部分。Wrapture 在这些思想基础上构建,为追踪和测试提供了更高级的 API,并与 OpenTelemetry 集成以实现可观测性。
参考链接:
- GitHub - GrahamDumpleton/wrapt: A Python module for …
- wrapt · PyPI
- GitHub - GrahamDumpleton/wrapture: Monkey patch, test, and …
标签: #Python, #testing, #tracing, #monkeypatching, #developer-tools
Playa Phone:火人节互动电话亭连接陌生人 ⭐️ 6.0/10
Playa Phone 是一个安装在火人节黑石城(3:30 与 Chomolungma 交叉口,飞行面条怪物神庙旁)的电话亭,2026 年再次回归,允许任何人拨打或接听全球任意地点的电话,每次通话五分钟。该项目由 aaron42net 创建,已持续多年,继续引发即兴对话和个人故事。 该项目体现了火人节的互动和社区驱动精神,将平凡物品转化为在偏远沙漠环境中促进人际连接的催化剂。它凸显了低技术装置如何创造有意义的、偶然的互动,并在活动结束后长久地引起参与者的共鸣。 电话亭位于 3:30 与 Chomolungma 交叉口,飞行面条怪物神庙前,每次通话限时五分钟。该项目已列入火人节 2026 年艺术清单,并受到 Adafruit 等技术博客的关注,创作者在 Reddit 上积极与社区互动。
hackernews · cutoff · 8月31日 14:52 · 社区讨论
背景: 火人节是每年在内华达州黑岩沙漠举行的为期一周的活动,强调社区、艺术和自我表达,广阔的干涸湖床上散布着大型艺术装置。Playa Phone 是一个参与式艺术项目,邀请参与者通过简单的电话与外界或彼此互动,与活动通常强调的与日常生活脱节形成对比。
参考链接:
- Playa Phone
- Talk To the Playaphone #BurningMan2026 #AxisMundi
- 2026 Art Listings – Burning Man Project
社区讨论: 社区评论总体积极,创作者 aaron42net 表示愿意回答问题,参与者分享了温馨轶事,例如在参观电话亭后意外举行了一场婚礼。一些评论者还推广了相关项目或对火人节的参与者构成表示好奇,而一位用户则讲述了与一位首次参加者的愉快通话经历。
标签: #Burning Man, #community project, #interactive art, #telephony
单个 HTML 文件中的可步行 ASCII 赛博朋克城市 ⭐️ 6.0/10
一位开发者展示了一个完全在单个 HTML 文件中渲染的可步行 ASCII 赛博朋克城市,更新中增加了交通、室内和摩天大楼。该项目仍在开发中,如视频演示所示。 这展示了基于浏览器的 ASCII 艺术的创意潜力,提供了一种使用纯文本渲染 3D 环境的独特方式。它可能激发爱好者和开发者探索类似技术,用于轻量级、复古风格的图形。 这座城市由方块构成,并通过 ASCII 字符屏幕观看,产生伪 3D 效果。该项目可在 GitHub 上获取,但一些评论者指出视频与仓库之间存在差异。
hackernews · keithcarolus · 8月31日 18:21 · 社区讨论
背景: ASCII 艺术是一种使用 ASCII 标准中的可打印字符来创建图像的设计技术。在这个项目中,开发者利用浏览器中的等宽字符渲染 3D 城市,利用字体控制和性能分析等浏览器功能,这些在终端环境中更具挑战性。
参考链接:
- ASCII CITY : a cyberpunk city explored in… - Boing Boing
- ASCII City – ZWENTNER.com
- A Walkable ASCII Cyberpunk City in One HTML File - YouTube
社区讨论: 社区评论褒贬不一:一位用户推荐基于浏览器的 ASCII 艺术而非终端,因为控制更好;另一位用户报告尝试项目时出现渲染问题。还有重复标记和关于 GitHub 项目是否与视频匹配的疑问。
标签: #ASCII art, #creative coding, #browser graphics, #demo, #cyberpunk