← 返回每日速递

Horizon · 2026-09-16

每日速递

中文

每日速递 - 2026-09-16

从 43 条内容中筛选出 13 条重要资讯。


  1. TypeSafe AI 发布 Jev:快速类型化推理模型 ⭐️ 8.0/10
  2. 电子墨水相框聆听鸟鸣并绘制成 19 世纪风格插画 ⭐️ 8.0/10
  3. 互联网档案馆因爬虫洪流为 Wayback Machine 增设防护 ⭐️ 8.0/10
  4. 谷歌发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking ⭐️ 8.0/10
  5. AI 代理 25 分钟内发现 Baseten 管理员 GitHub 令牌 ⭐️ 8.0/10
  6. 开发者利用 LLM 在一个月内为 M4 Mac Mini 构建 Linux GPU 驱动 ⭐️ 8.0/10
  7. 莱茵金属开源 Battlesuite 武器系统协议 ⭐️ 7.0/10
  8. 传奇数学家让-皮埃尔·塞尔百岁诞辰 ⭐️ 7.0/10
  9. FPGA 重现 3dfx Voodoo 与九十年代末游戏 PC ⭐️ 7.0/10
  10. ZGCM-1:面向数学与智能体搜索的全开放 7B 基础模型 ⭐️ 7.0/10
  11. PhysMent 基准通过 MuJoCo 交互测试大模型物理推理能力 ⭐️ 7.0/10
  12. 视觉语言模型可供性预测的瓶颈在于部件定位而非动作知识 ⭐️ 7.0/10
  13. Wasserstein 空间 P2 上的随机梯度下降获得高斯近似 ⭐️ 7.0/10

TypeSafe AI 发布 Jev:快速类型化推理模型 ⭐️ 8.0/10

TypeSafe AI 发布了其首个 System One 模型 Jev,它放弃了逐词元生成文本的方式,转而并行回答结构化问题,并返回带有概率和置信度分数的类型化输出。该公司声称推理速度提升 20-200 倍,成本降低 40-400 倍,每百万输入词元仅需 0.042 美元,目前已开放早期访问。 这代表了一类新型 AI 模型,旨在做出软件可直接使用的快速结构化决策,有望在分类、路由和自动化流程中替代昂贵的 LLM 调用。它可能大幅降低将 AI 集成到生产软件系统中的成本和延迟障碍。 Jev 完全放弃了字符串生成,专为结构化输出优化,TypeSafe 声称这意味着它不会产生幻觉;但其最大的性能声明仍为内部测试结果。该模型以非结构化状态作为输入,返回类型化的概率决策,功能类似于前沿智能函数调用。

hackernews · albelfio · 9月15日 19:25 · 社区讨论

背景: System One 模型是一类新型 AI 模型,旨在做出软件可直接使用的快速结构化决策,与生成自由文本的通用生成模型不同。Jev 评估状态并返回类型化答案和概率,适用于需要确定性、可验证输出的分类和路由等任务。契约式设计模式通过对软件组件强制执行前置和后置条件,已被探索用于与 LLM 结合以实现更可靠的结构化输出。

参考链接:

社区讨论: 社区成员称赞其新颖性,但质疑速度对比具有误导性,指出 Jev 仅生成结构化输出,而图灵完备的生成模型可以做任何事情。一些人在看到家庭助手演示后觉得价值凸显,另一些人则强调其与契约式设计模式结合的潜力。多位评论者指出公告本身缺乏清晰解释,并推荐查阅文档以获得更好理解。

标签: #LLM, #typed inference, #structured output, #design-by-contract, #AI


电子墨水相框聆听鸟鸣并绘制成 19 世纪风格插画 ⭐️ 8.0/10

一位名为 arnegiacomo 的创客在 GitHub 上发布了一个名为“fugleramme”(鸟框)的项目,它通过麦克风聆听鸟鸣,使用 BirdNET 神经网络进行分类,并在电子墨水屏上将识别出的鸟种渲染成 19 世纪风格的插画。该 Show HN 帖子获得了 1327 分和 183 条评论,社区称赞它是嵌入式硬件、机器学习和艺术的美妙结合。 该项目展示了像 BirdNET 这样易于获取的机器学习模型如何与低功耗电子墨水屏和微控制器结合,创造出迷人的、常开的氛围设备。它还凸显了 DIY 鸟类监测项目日益增长的浪潮,暗示了业余生物声学和智能家居小物件领域更广泛的趋势。 BirdNET 是一个传统的深度学习分类器而非大语言模型,专门针对鸟鸣训练,项目运行在嵌入式硬件(可能是 ESP32 或类似芯片)上并搭配电子墨水屏。社区成员指出,蓝牙低功耗(BTLE)电子墨水屏驱动在 2000mAh 电池下即使每天多次刷新也能续航数年,这与基于 Wi-Fi 的方案不同。

hackernews · arnemunthekaas · 9月15日 12:31 · 社区讨论

背景: 电子墨水(电子纸)显示屏模仿纸上墨水的视觉效果,仅在图像变化时消耗电力,因此非常适合低功耗、常显的设备。BirdNET 是由康奈尔鸟类学实验室等机构开发的预训练深度神经网络,能够从音频录音中识别鸟种。ESP32 是一款流行且廉价的微控制器,内置 Wi-Fi 和蓝牙,广泛用于 DIY 物联网和硬件项目。

参考链接:

社区讨论: 评论者热情高涨,有人称其为“HN 上最酷的东西”并称赞其神奇之处。其他人澄清 BirdNET 是传统神经网络而非大语言模型,并分享了 birdnet-go 和 Avian Visitors 等相关项目。实用建议包括使用 eBird API 实现无麦克风入门,以及利用 BTLE 电子墨水屏驱动实现长达一年的电池续航。

标签: #e-ink, #embedded-systems, #bird-classification, #ESP32, #hardware-projects


互联网档案馆因爬虫洪流为 Wayback Machine 增设防护 ⭐️ 8.0/10

互联网档案馆于 2026 年 9 月 15 日报告称,Wayback Machine 遭到多波高流量自动化抓取流量的冲击,被迫部署新的防护措施,导致普通用户的访问体验下降。该机构还指出,由于这种滥用行为,一些网站已开始选择退出被归档。 互联网档案馆是保存网络历史的关键公共基础设施,因此持续的抓取压力既威胁其运营,也威胁它所守护的历史记录。如果网站继续选择退出,未来的研究者和公众可能会失去对原本会消失的网页存档版本的访问。 这些防护措施导致合法用户访问不稳定,并频繁出现 429“请求过多”错误;档案馆表示,这些流量很可能来自试图绕过原始网站封锁、转而抓取存档副本的爬虫。一些用户报告称,错误出现在特定网络上(例如公司网络),而其他网络则正常。

hackernews · ChrisArchitect · 9月15日 17:52 · 社区讨论

背景: Wayback Machine 是由非营利组织互联网档案馆运营的免费服务,自 1996 年以来一直保存网站快照,让任何人都能查看网页过去的样子。网站所有者历来可以通过 robots.txt 或直接请求选择退出归档,而档案馆长期在这一点与普遍访问的使命之间寻求平衡。近来,AI 公司激进的网络抓取给许多网站带来压力,一些出版商出于担心 AI 公司把存档内容当作后门,已封锁了档案馆的爬虫。

参考链接:

社区讨论: 评论者普遍称赞互联网档案馆是至关重要的开放基础设施,并呼吁提供资金支持;simonw 认为这些流量很可能来自绕过原始网站封锁的 AI 爬虫。其他人报告了访问不稳定和 429 错误,还有人建议 AI 公司应为访问档案馆付费。

标签: #internet-archive, #web-scraping, #open-web, #infrastructure, #ai-crawlers


谷歌发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking ⭐️ 8.0/10

谷歌发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这是其迄今最先进的实时对话模型,旨在让语音交互更加自然、流畅和智能。这些模型能够处理复杂推理、实时视觉上下文以及后台任务执行,而不会打断用户的对话流程。 此次发布巩固了谷歌在快速演进的对话式 AI 竞赛中的地位,低延迟语音交互和多模态理解正成为其与 OpenAI、Anthropic 等对手竞争的关键战场。工作区账户支持等改进也扩大了企业用户的可及性,此前这些用户常被排除在近期发布之外。 Gemini 3.8 Live 面向规模化日常对话场景,而 Gemini 3.8 Live Extended Thinking 则针对高复杂度任务,具备更强的智能和多步推理能力。此次发布紧随两周前的 Gemini 3.8 Flash 和 3.8 Flash Cyber,显示出谷歌快速迭代模型的节奏。

hackernews · leumon · 9月15日 17:38 · 社区讨论

背景: Gemini 是谷歌的旗舰多模态 AI 模型系列,能够处理并整合文本、音频、图像和视频等多种数据类型。Live 模型专门针对实时语音对话进行优化,这在技术上颇具挑战,因为需要低延迟以及边听边说边推理的能力。Extended Thinking 变体则增加了更深入的逐步推理能力,以部分速度换取在复杂问题上的更高准确性。

参考链接:

社区讨论: 社区反应总体积极,用户称赞其低延迟、悦耳的音色以及对浓重口音的稳健处理,并且终于可以在工作区账户上使用。部分用户强调 Gemini 在创意写作和捕捉南非荷兰语等小众语言本地化细微差别方面的优势,但也有人批评其仍然存在幻觉问题,并指出尽管谷歌拥有数据、TPU 硬件和广告资源,仍落后于竞争对手。

标签: #Gemini, #Google, #AI, #LLM, #Model Release


AI 代理 25 分钟内发现 Baseten 管理员 GitHub 令牌 ⭐️ 8.0/10

Strix 的 AI 安全代理在 25 分钟内发现了一个有效的 GitHub 个人访问令牌(属于 ‘basetenbot’ 账户),该令牌拥有对 Baseten 生产仓库、GitOps 基础设施和 Homebrew tap 的管理员及推送权限。该令牌是在找到公开的 Baseten 镜像仓库后,从 Docker 构建历史中发现的。 这一事件凸显了 AI 驱动的渗透测试日益强大的能力,以及 CI/CD 管道中秘密泄露的持续风险,可能导致供应链被攻破。它强调了组织需要保护构建产物并及时轮换凭证。 该令牌提供了对 Baseten 主产品仓库、驱动其集群的 GitOps 仓库以及 Homebrew tap 的管理员权限,以及对其他私有仓库的读写权限。Baseten 的回应是将 Harbor 项目设为私有并轮换令牌,但最初的暴露窗口持续了一天多。

hackernews · bearsyankees · 9月15日 18:11 · 社区讨论

背景: Baseten 是一个用于在生产环境中部署和运行机器学习模型的 AI 推理平台。GitHub 个人访问令牌(PAT)用于对 GitHub API 进行身份验证,如果未正确限定范围,可能拥有广泛的权限。如果秘密作为构建参数或环境变量传递,Docker 构建历史可能会无意中存储这些秘密,使其成为常见的泄露途径。

参考链接:

社区讨论: 评论者赞扬了 Baseten 的回应,但争论该发现是展示了独特的 AI 能力,还是仅仅加快了扫描速度。一些人质疑在没有明确许可的情况下进行此类自动化渗透测试的合法性,而另一些人则认为这是 Strix 的有效营销。

标签: #security, #AI-agents, #supply-chain, #GitHub, #penetration-testing


开发者利用 LLM 在一个月内为 M4 Mac Mini 构建 Linux GPU 驱动 ⭐️ 8.0/10

一位名叫 Cody Ho 的开发者利用大型语言模型(LLM)逆向工程了苹果 AGX GPU 的固件 ABI 和用户空间组件,在一个月内为 M4 Mac Mini 构建了一个可用的 Linux GPU 驱动。该工作自称以净室方式完成,但引发了争议,因为作者是前苹果工程师,且此前因隐瞒 LLM 使用而被 Asahi Linux 项目封禁。 这一成果展示了 LLM 在显著加速硬件逆向工程方面的潜力,可能将传统上需要数年的工作缩短。然而,它也引发了关于在净室开发中使用 AI 的伦理和法律问题、训练数据的来源,以及此类代码能否被上游 Linux 内核接受的严肃质疑。 该驱动针对苹果的 AGX GPU 架构,该架构集成在 M4 SoC 中,与 CPU 和神经引擎共享统一内存。作者声称逆向工程是以透明且可验证的净室方式完成的,但 Asahi Linux 项目有严格的禁止 AI 政策,这意味着该驱动无法通过他们的努力被上游接受。

hackernews · ADevWithAnIdea · 9月15日 19:30 · 社区讨论

背景: 像 M4 这样的苹果芯片将 CPU、GPU 和其他组件集成在单一系统级芯片(SoC)上,并采用统一内存,这与传统的独立 GPU 不同。对这些芯片的 Linux 支持主要由 Asahi Linux 项目开发,该项目对未公开的硬件进行逆向工程。编写 GPU 驱动通常需要深入了解硬件的固件和接口,这一过程可能需要数年时间。

参考链接:

社区讨论: 社区讨论分歧严重:一些人赞扬这一技术壮举,认为这是 LLM 的绝佳应用案例;而另一些人则谴责作者隐瞒其苹果员工身份和 LLM 使用,认为该工作受到污染且无法上游。还有人担心法律风险,因为苹果就商业机密提起诉讼,以及 Asahi Linux 的禁止 AI 政策,并预测尽管存在伦理反对,AI 辅助的分支可能会占据主导。

标签: #Linux, #GPU driver, #Apple Silicon, #LLM, #reverse engineering


莱茵金属开源 Battlesuite 武器系统协议 ⭐️ 7.0/10

德国防务承包商莱茵金属公司发布了其 Battlesuite 联网武器系统的板载 API 文档,在 GitHub 上以开源模式公开了该协议 9.10.0 版本。该协议定义了 Battlesuite 生态系统内传感器、效应器及其他组件之间的通信方式。 一家大型防务制造商将武器系统的协议层开源极为罕见,此举可能降低第三方供应商和盟国军队的集成门槛。同时,这一举动也引发了公众对联网武器平台技术与伦理层面的审视。 该协议基于 DDS(数据分发服务)构建,这是 OMG 发布的一种以数据为中心的发布-订阅中间件标准,可提供低延迟、可扩展的数据连接,但常被批评对嵌入式系统而言过于笨重。文档托管于 rheinmetall.github.io/onboardapi-documentation/9.10.0。

hackernews · summarity · 9月15日 21:07 · 社区讨论

背景: 莱茵金属的 Battlesuite 是一个军事生态系统,通过中央数据枢纽连接武器、无人机及其他战场资产,其基础是 blackned 公司的 Tactical Core 操作系统,并以类似智能手机应用架构的模块化应用进行扩展。DDS 是国防和工业系统中广泛使用的实时数据交换中间件标准。将协议开源可让外部开发者无需逆向工程即可构建兼容组件,但也会将设计选择暴露于公众批评之下。

参考链接:

社区讨论: Hacker News 的评论者将该协议与现有军事标准进行了比较,如 TMS(MIL-STD-3071)、OMS、DIS(IEEE 1278)和 HLA(IEEE 1516),有人指出它类似于对分布式仿真架构的重新实现。一些人对该协议基于 DDS 表示失望,认为 DDS 对无动态内存分配的嵌入式系统而言过于笨重;另一些人则对为武器系统构建集成提出了伦理方面的担忧。

标签: #defense, #protocol, #open-source, #DDS, #embedded-systems


传奇数学家让-皮埃尔·塞尔百岁诞辰 ⭐️ 7.0/10

20 世纪最具影响力的数学家之一让-皮埃尔·塞尔于 2026 年 9 月 15 日迎来百岁诞辰。这一里程碑在 Hacker News 上引发了热烈讨论,人们分享了他的人生与工作,并链接了欧洲数学学会的新访谈以及个人轶事。 塞尔在代数拓扑、代数几何和代数数论领域的工作塑造了现代数学超过五十年,他同时获得菲尔兹奖(1954 年)和首届阿贝尔奖(2003 年)的罕见成就彰显了其持久的遗产。社区的参与表明他的思想仍在激励着研究人员和学生。 塞尔因在代数拓扑方面的工作于 1954 年获得菲尔兹奖,并于 2003 年获得首届阿贝尔奖;他还于 2000 年获得沃尔夫数学奖。欧洲数学学会为庆祝他的百岁诞辰发布了一篇新的访谈。

hackernews · jzox · 9月15日 20:57 · 社区讨论

背景: 让-皮埃尔·塞尔是一位法国数学家,生于 1926 年 9 月 15 日,以在代数拓扑、代数几何和代数数论方面的基础性贡献而闻名。他是少数同时获得菲尔兹奖和阿贝尔奖的数学家之一,其著作如《树》和《有限群的线性表示》至今仍具有影响力。

参考链接:

社区讨论: 评论者分享了个人轶事,例如喜欢塞尔的《树》一书,并赞赏他对不喜欢ε-δ语言的观点。其他人则提到了欧洲数学学会的新访谈,并指出塞尔关于写线性表示一书是为了履行丈夫职责的幽默言论。

标签: #mathematics, #Jean-Pierre Serre, #biography, #Hacker News, #community


FPGA 重现 3dfx Voodoo 与九十年代末游戏 PC ⭐️ 7.0/10

一位开发者发布了一篇详细博客文章,记录了用 FPGA 重现九十年代末游戏 PC 的项目,其中包含 3dfx Voodoo Graphics 显卡,并在 Hacker News 上引发了讨论。 该项目表明 FPGA 硬件仿真不仅能重现单台游戏主机,还能完整复现一台符合时代特征的 PC,为复古游戏爱好者提供了比软件模拟更忠实的替代方案。 该复刻项目面向九十年代末的 PC 时代,将 486 级 CPU 与 3dfx Voodoo Graphics 搭配使用——后者是仅支持 3D 的附加显卡,需要独立的 2D VGA 芯片;社区成员质疑该 FPGA 486 是否支持《古墓丽影》(1996)等游戏所需的额外 Pentium 指令。

hackernews · zdw · 9月15日 22:50 · 社区讨论

背景: 3dfx 于 1996 年 11 月发布 Voodoo Graphics 芯片组,它是一块仅支持 3D 的附加显卡,需与已有的 2D VGA 显卡配合使用,被广泛认为通过让全多边形 3D 图形变得普及而彻底改变了 PC 游戏。FPGA 仿真直接在可重构逻辑中实现硬件行为,正如 MiSTer 项目使用 Altera Cyclone FPGA 所做的那样,其准确性可能高于软件模拟。九十年代末的游戏 PC 通常搭配 Pentium 级 CPU、SDRAM 以及 Voodoo 之类的 3D 加速卡。

参考链接:

社区讨论: 评论者提出了实际问题:有人询问该 FPGA 486 是否支持《古墓丽影》(1996)所需的额外 Pentium 指令;另一位惋惜自己在 MiSTer 开机状态下热插拔 HDMI 导致接口损坏;还有一位想知道该项目是否支持 31kHz VGA 输出,以便搭配符合时代的显示器。

标签: #FPGA, #retro-computing, #Voodoo Graphics, #hardware emulation, #gaming PC


ZGCM-1:面向数学与智能体搜索的全开放 7B 基础模型 ⭐️ 7.0/10

研究团队发布了 ZGCM-1,这是一个完全开放的 7B 稠密基础模型,从零开始训练,采用端到端高效训练方案:交错门控滑动窗口与全注意力、稳定的 FP8 Muon 优化器、渐进式上下文扩展至 256K,以及基于 MDP 的中期训练。在具有挑战性的数学推理和智能体搜索评测集上,该模型可与规模大几个数量级的前沿模型(如 Qwen3-235B-A22B 和 GLM-5.1)相竞争,并且团队开源了模型权重、中间检查点、训练代码、各阶段数据配方以及 W&B 日志。 这项工作表明,紧凑的 7B 模型可以通过将内部思考与主动外部工具使用相结合,突破参数容量限制,从而挑战了只有超大规模模型才能处理前沿数学与智能体搜索任务的假设。其完全开源的权重、检查点、数据配方和日志为开放模型与效率研究社区提供了罕见的端到端可复现成果,而报告的在 16K 上下文下约 4.2 倍的预训练时间到损失效率提升,可能影响未来模型的训练方式。 训练方案包括架构与系统协同设计,采用交错门控滑动窗口与全注意力、稳定的 FP8 Muon 优化器、在 16K、64K 和 256K 上渐进扩展上下文的课程学习,以及在中期训练中将交互轨迹重构为马尔可夫决策过程。团队还建立了 AI 原生的研发工作流,由智能体集群自主管理集群运维、数据整理和快速诊断评估,并提炼出八条可操作的实证发现,涵盖架构扩展、SFT 质量剪枝、长上下文泛化和智能体协同训练动态。

rss · arXiv cs.AI · 9月15日 04:00

背景: 滑动窗口注意力将每个 token 限制在之前的局部窗口内,从而减少计算量和 KV 缓存内存,而全注意力则允许 token 进行全局关注;将两种模式交错使用可以让模型在效率和长程推理之间取得平衡。Muon 优化器是 AdamW 之外较新的选择,已被证明收敛更快,但传统上保留 FP32 优化器状态,因此以 FP8 运行它是一项有意义的内存与速度优化。马尔可夫决策过程(MDP)是在不确定性下对序贯决策建模的标准框架,这里被用于在中期训练中组织模型的多步交互轨迹。智能体搜索指模型主动调用外部工具或搜索引擎,而不仅仅依赖记忆中的参数。

参考链接:

标签: #foundation-models, #efficient-training, #agentic-search, #long-context, #open-models


PhysMent 基准通过 MuJoCo 交互测试大模型物理推理能力 ⭐️ 7.0/10

研究者提出了 PhysMent,一个通过与大语言模型与 MuJoCo 物理模拟器进行迭代式、工具中介交互来评估其物理推理能力的基准,包含 105 个经典力学场景,覆盖四种难度设置和三种场景模态。与静态基准不同,模型必须在作答前主动施加力、查询物体状态、推进时间并修改场景几何,结果显示七个模型的准确率在 25% 到 67% 之间。 该基准将评估从静态问答转向主动实验,揭示当前大语言模型在定量多步任务上的失败主要源于程序性能力不足,而非概念性缺陷。这凸显了将大语言模型作为智能体部署于机器人和科学推理领域时的关键局限,因为自适应工具使用在这些场景中至关重要。 该基准将 105 个场景组织为简单/困难与单概念/多概念设置,包含三种场景模态(标准、物体创建、隐藏物体)以及一个场景操作类别,并采用六维评分框架。模型在定性单概念任务上准确率可达 80%,但在最困难的单概念类别上多数低于 30%,失败原因包括过早提交答案、探索效率低下以及对模拟器反馈的利用不一致。

rss · arXiv cs.CL · 9月15日 04:00

背景: MuJoCo(Multi-Joint dynamics with Contact)是由 Google DeepMind 维护的免费开源物理引擎,用于模拟铰接结构与接触动力学,广泛应用于机器人和机器学习研究。静态科学基准通常直接提供所有所需数值,因此无法测试模型能否通过实验主动获取信息。PhysMent 延续了 ToolSandbox 等工具使用基准的思路,要求模型逐步与模拟器交互。

参考链接:

标签: #LLM reasoning, #physics simulation, #benchmark, #MuJoCo, #tool-mediated interaction


视觉语言模型可供性预测的瓶颈在于部件定位而非动作知识 ⭐️ 7.0/10

一篇新的 arXiv 论文(2609.13225)将可供性问题中被混为一谈的两个步骤区分开来——识别物体上应作用于哪个部件,以及知道该部件需要什么动作——并在 19 个铰接物体上测试了八个视觉语言模型。在开放式提示下,push 在 64 次本应正确的评估中仅被产出一次;但一旦明确命名目标部件,所有模型的动作准确率提升 0.32 至 0.63,push 召回率从 0-1/8 升至 7-8/8。 这一发现将视觉语言模型在低级操作任务上的失败重新定义为定位问题,而非动作知识缺失,可能引导模型设计与评估转向部件级定位。它还界定了完美部件检测器所能带来的收益上限,为机器人和视觉语言模型研究者提供了明确的诊断方向。 在开放式提示下,没有任何模型能胜过忽略图像的常数答案;但一旦命名部件,八个模型全部胜出。在真实照片上,八个模型中仅三个在抓取点定位上优于常数基线,在渲染物体上则无一胜出。作者还记录了自己的两个测量错误——一个让常数基线得分 0.929 的阈值,以及一个在 19 个物体中有 4 个标注错误的规则——两者都是通过与平凡替代方案对比才被发现。

rss · arXiv cs.CV · 9月15日 04:00

背景: 可供性预测关注机器人应对物体施加何种动作,而视觉语言模型(VLM)在机器人领域正越来越多地用于此任务。基准测试普遍认为 VLM 在低级操作推理上表现不佳,但总体准确率分数无法揭示究竟哪一步失败。本文在三个模型家族中分离出部件定位——即识别应作用于哪个具体部件——是主要瓶颈,且这一模式并不随模型能力提升而减弱。

参考链接:

标签: #vision-language models, #affordance prediction, #robotics, #part grounding, #model evaluation


Wasserstein 空间 P2 上的随机梯度下降获得高斯近似 ⭐️ 7.0/10

一篇新的 arXiv 论文(2609.13343)为随机梯度下降构建了高斯随机场近似,其目标函数定义在 Wasserstein 空间 P2 上。作者利用 Lions 可微性将问题提升到希尔伯特空间,并证明该近似以二阶弱精度捕捉 SGD 的动态。 这项工作将经典的 SGD 扩散近似从欧几里得参数空间推广到无限维非线性测度空间,为分析概率测度上的随机优化提供了严格基础。它可能惠及平均场神经网络训练、变分推断以及基于采样的优化等理论驱动领域。 P2 的非线性几何与无限维特性阻碍了直接套用欧几里得理论,因此作者借助 Lions 可微性将问题提升到可进行高阶微积分的线性希尔伯特空间。高斯随机场通过高阶泰勒展开匹配原始随机梯度的均值与协方差来构造。

rss · arXiv stat.ML · 9月15日 04:00

背景: Wasserstein 空间 P2 是二阶矩有限的所有概率测度构成的集合,配备最优传输距离 W2,是一个非线性、无限维的度量空间。随机梯度下降通常通过扩散近似来分析,即用高斯噪声替代随机梯度中的噪声,但经典理论假设参数空间是欧几里得的。Lions 可微性是定义在概率测度上的函数的导数概念,是平均场博弈与 McKean–Vlasov 动力学的核心工具,使得在 P2 上进行微积分成为可能。

参考链接:

标签: #stochastic gradient descent, #Wasserstein space, #optimization, #Gaussian approximation, #machine learning theory