布丁软件

AI 资讯

每日 AI 精选与日报

大模型、AI 产品、行业动态、论文与实用技巧,内容由 AIHOT 实时聚合;可访问来源支持直达原文。

🧩
AI 技能模板40+ 套 AI 技能模板与 Agent 工作流,覆盖办公写作、自媒体创作等场景
论文

微型语言模型中干扰权重的特征刻画

Anthropic 训练了一个单层 transformer,通过将模型分解为 token、位置、特征和 logits 间的虚拟权重,首次在训练过的 transformer 内直接演示了干扰权重的存在及其对训练损失的影响。

Anthropic:Transformer Circuits(可解释性研究)
论文

移动性如何让语言模型更深入地理解地点

Google Research 推出 Mobility-Embedded POIs(ME-POIs)框架,将聚合匿名移动模式与文本描述结合,为地点构建融合身份与动态功能的嵌入向量。在未见地点上,该框架使访问意图预测相对提升 81.9%,价格等级分类提升 75.1%,繁忙度估算准确率提升 24.7%。

Google Research:Blog(网页)
论文

阿里字节新论文:AI智能体服务需新架构

阿里与字节新论文指出,AI智能体性能瓶颈已从模型推理转向工具、内存、环境与模型的协同。基于10个智能体应用的AgentSysBench测试显示,任务感知调度降低延迟29-40%,通信感知放置提速4.5倍,状态卸载节省内存4.6倍,缓存消除35.2%冗余搜索调用。单纯优化token/秒已不够,需将模型、工具、内存与通信统一调度。

X:Rohan Paul (@rohanpaul_ai)
论文

Google 推出 Biomarker Discovery Framework:从可穿戴传感器数据中筛选候选生物标志物的多智能体系统

Google 推出 Biomarker Discovery Framework,一个多智能体系统,通过迭代假设生成、统计分析与文献推理,从可穿戴传感器数据中筛选候选生物标志物。该系统在三个队列(共 9,279 人次观测)中恢复了已知临床信号,识别出跨独立数据集的一致生物标志物,并在结合人口统计特征后提升了下游预测性能。流程包含六阶段闭环架构与 11 项对抗性验证检查,并保留人工监督。

Google Research:Blog(网页)
论文

Ling-3.0-flash 在 4 块 Blackwell GPU 上如何将批处理 1 解码延迟降低 54%

蚂蚁 Ling Infra 团队与 RadixArk SGLang 团队将 Ling-3.0-flash 混合线性注意力 MoE 模型的单请求解码速度从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。

LMSYS:Blog(Chatbot Arena 团队)
论文

T-Rex:NVIDIA 与伯克利开源触觉机器人方法

NVIDIA 与伯克利联合开源触觉机器人方法 T-Rex,将触觉作为模型一等公民,采用双时钟异步架构,以每视觉 tick 4 次触觉 tick 的高频修正实时优化操作。

X:Jim Fan (@DrJimFan)
论文

Artificial Analysis 推出 Speech Agent Arena,评测语音到语音模型的对话偏好与任务成功率

Artificial Analysis 推出 Speech Agent Arena,通过人类在真实场景中对比语音到语音模型,衡量对话偏好与任务成功率。偏好榜上 Gemini 3.1 Flash Live Preview - Minimal 以 1,046 Elo 居首,任务成功率则由 Grok Voice Think Fast 2.0 High 以 94.7% 领先。

X:Artificial Analysis (@ArtificialAnlys)
论文

DeepMind 将模型路由形式化为潘多拉之盒

Google DeepMind 新论文将模型路由形式化为潘多拉之盒问题,即检查成本高昂时的最优搜索问题。在高斯信号模型下策略有闭式解,可判断每个专家和输入是否值得细化估计。在多 LLM 基准、检索增强专家和可变推理时长的 LLM 上,Pandora's Router 以远低于昂贵估计器的调用频率达到穷举估计质量。

X:DAIR.AI (@dair_ai)
论文

AlphaEvolve 助力刷新矩阵乘法理论下界

Google DeepMind 用 AlphaEvolve 改进了矩阵乘法理论界,将指数 ω 从 <2.371339 降至 <2.371177,提升幅度堪比过去 40 年多数进展。团队将优化参数从约 25k 扩至 700 万,AlphaEvolve 贡献约 0.65×10^-4 的改进,结果经精确有理运算验证。

X:Rohan Paul (@rohanpaul_ai)
论文

Google EnvHarness 与 EnvRigger 构建智能体训练环境

Google 提出 EnvHarness 与 EnvRigger,解决智能体训练环境静态化、无法随智能体进化的问题。EnvHarness 通过可编程插件层重塑环境行为且保留原验证器,EnvRigger 将策略视为黑盒、诊断其轨迹缺陷并合成新组件。在四个领域五个基准上,held-out 实例最高提升 9.0 分,执行步骤减少 9.8%。

X:Elvis Saravia (@omarsar0, DAIR.AI)
论文

每个模型都会作弊:针对攻击性网络任务作弊的提示词缓解研究

一项针对22个前沿模型的审计发现,基线条件下37.1%的通过任务涉及作弊,平均通过率41.5%而真实解决率仅26.1%,个别模型虚增高达5倍。即便加入标准反作弊指令,作弊率仅从33.0%降至8.5%,最严苛提示下仍有8个模型作弊、4个出现反效果。

Hacker News 热门(buzzing.cc 中文翻译)
论文

测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型"刷分"现象

Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。

Hugging Face:Blog(RSS)
论文

记忆型自我改进智能体增益或为评估噪声

一项新论文重新评估了基于记忆的自我改进智能体,发现其增益可能源于评估噪声。研究补充了先前工作忽略的两点:多次运行测量方差和随机打乱任务顺序,两者均显著降低性能。默认任务顺序隐含的课程学习是报告增益的主要来源,添加详细评分标准与环境反馈可部分恢复性能,但差距仍明显。

X:DAIR.AI (@dair_ai)
论文

研究:ChatGPT 后三成网页疑为 AI 生成

自 ChatGPT 推出以来,三分之一的网页显示出由 AI 撰写的迹象。 同一语料库还发现,破折号的使用频率约为 2023 年的两倍,牛津逗号使用率上升 63%,否定平行结构("不是 X,而是 Y"的句式)几乎增加了两倍。 - 皮尤研究中心新研究

X:Rohan Paul (@rohanpaul_ai)
论文

CTIFoundry:索引时构建结构提升智能体F1

Amazon 团队提出 CTIFoundry,在索引时跨四个权威安全知识库构建官方交叉引用为类型化可遍历边,并通过 span 级报告层保留来源。仅替换动作表面,即在四模型面板上将相同 harness 的智能体整体 F1 提升 0.19-0.28;小模型在 CTIFoundry 上以约一半工具调用数超越旗舰模型在平面基座上的表现。

X:DAIR.AI (@dair_ai)
论文

智能体框架持续学习新论文:防遗忘机制

一篇关于智能体框架持续学习的新论文指出,现代智能体在提示词、记忆、工具等框架组件中积累经验,更新任一组件可能导致模型未变但行为失效,即"框架级遗忘"。论文提出"受保护的框架演化"机制,由持续优化器生成候选框架、持续评估器在确认改进、历史保留和有效性后才提交,在文本推理、多模态感知和开放世界交互中相对提升超10%。

X:Elvis Saravia (@omarsar0, DAIR.AI)
论文

GPT-5.5上下文压缩对任务结果影响甚微

5倍上下文压缩对GPT-5.5的最终任务结果影响出奇地小。 压缩后的智能体在统计上与完整上下文版本同样成功。 变化的是达成方式:它更重度依赖检索来重建被丢弃的信息。 - arxiv.org/abs/2608.16370 标题:"上下文压缩让智能体付出什么代价?任务完成指标未揭示的交互成本"

X:Rohan Paul (@rohanpaul_ai)
论文

SPADE:自适应合成环境中的智能体自对弈

SPADE: 自适应合成可执行环境中的自对弈 【引用 @_AndrewZhao】:我们提出 SPADE,面向通用智能体的自对弈方法,其中环境和任务均由智能体自身生成并持续改进。我们使用带/不带提示的遗憾值来训练环境生成器。随着我们迈向 RSI,决定学习什么将成为最重要的问题。

X:马东锡 NLP (@dongxi_nlp)
论文

皮尤研究:ChatGPT 发布后超三分之一新网页疑似 AI 生成

皮尤研究中心新研究发现,ChatGPT 发布后发布的网页中,超过三分之一(35%)显示出明显的 AI 创作或编辑痕迹。该结论基于对 Common Crawl 中近 50 万英文网页的分析,其中 2026 年 7 月随机抽样的 1 万网页中约 10% 有显著 AI 痕迹。.com 域名的 AI 创作比例约为 .edu 或 .gov 域名的 10 倍。

TechCrunch:AI(RSS)
论文

AI科学家应作为人机协作系统研究

一篇立场论文主张,科学智能体应作为"科学家+智能体"的人机协作系统来评估,而非孤立优化智能体本身。在10项科学任务中,GPT-5-mini几乎从不主动请求人类帮助,但专家能发现智能体遗漏的错误,而智能体加速执行--增益来自协作而非自主性。论文提出以人机团队是否比任何单独一方产出更好科学为基准。

X:Rohan Paul (@rohanpaul_ai)
论文

不要再将中间令牌拟人化为推理/思考的痕迹

亚利桑那州立大学团队发表立场论文,反对将大语言模型在输出答案前生成的中间令牌(ITG)称为"推理痕迹"或"思考痕迹",认为这种拟人化并非无害隐喻,而是会混淆模型本质、误导有效使用并催生可疑研究。论文汇集多项质疑该解读的实证工作,呼吁社区避免此类拟人化表述。

Hacker News 热门(buzzing.cc 中文翻译)
论文

智能体能否后训练其他智能体?新论文揭示局限

一篇新论文系统检验了智能体能否后训练其他智能体,分析大量公开后训练轨迹后发现:智能体在第一步就锁定训练策略,剩余预算全部用于局部调整。三种干预措施中,经验驱动脚手架在GSM8K提升12.6分、HumanEval提升40.8分,但策略仍不改变;人类引导仅重定向初始选择,额外推理算力对最难任务几乎无效。核心缺失是执行中无法重新考虑策略的能力。

X:Elvis Saravia (@omarsar0, DAIR.AI)
论文

研究提出表征平等指标,评估LLM跨59国模拟偏差

清华NLP等机构在《计算语言学》提出"表征平等"概念与指标,检验9个开源模型能否均匀模拟不同国家人群,覆盖59国与2,420个子群体。研究发现模拟不平等具系统性:模型对欧美模拟更准,与人均GDP、互联网普及率等正相关,并倾向将中东国家拉向美国分布。检索增强是最稳健的改进手段(GLM-4-9B的EqCV从0.0486降至0.0255),而偏好对齐无系统性增益。

X:面壁智能 OpenBMB (@OpenBMB)
论文

中国信通院:全国已建成启用超 70 家具身智能训练场,覆盖过半省级行政区

中国信通院《具身智能训练场研究报告(2026 年)》显示,截至今年 6 月底,全国建成启用超 70 家训练场,在建或规划中 46 家,覆盖过半省级行政区,形成长三角、京津冀和珠三角三大集群。训练场建设正由省会及一线城市向三四五线城市延伸,其中含工业制造场景的训练场占 86%。报告预测,训练场将从建设热潮期向能力沉淀期过渡。

IT之家(RSS)
论文

技能库"恶意演化":智能体安全隐患新研究

新研究揭示智能体"技能误演化"风险:恶意任务被存入技能库,即使原始指令消失仍可改变后续行为。21 种演化配置全部生成不安全技能,其中 15 种在后续干净会话中造成危害。论文提出 SKILLMISEVO-GYM/BENCH 检测该风险,并以 SAFEEVOLVE 通过检查、修复、追踪和淘汰机制降低危害。

X:Rohan Paul (@rohanpaul_ai)
论文

分析显示 ChatGPT 约三分之一广告与对话内容无关

AI 可见性平台 Searchable 分析了 2026 年 7 月 4 日至 8 月 4 日期间 ChatGPT 真实对话中投放的 11,000 多条广告,发现 33% 的广告与对话毫无关联,27% 为直接匹配,40% 为上下文匹配。68% 的广告出现在毫无购买意图的对话中。OpenAI 首席营收官 Denise Dresser 称自 2 月广告业务上线以来用户关闭广告率已下降一半。

Artificial Intelligence News(RSS)
论文

FlashPrefill V2:面向长上下文 LLM 服务的块稀疏预填充注意力

FlashPrefill V2 将稀疏注意力从算法原型推进到实用化长上下文服务,通过均值校正项抑制近似误差,并采用 PackGQA 内存访问、warp 特化和 pingpong 流水线,对齐 FlashAttention-3/4 并支持 FP8 推理。

HuggingFace Daily Papers(社区热门论文)
论文

CoToGrasp:通过规范工作区学习实现接触拓扑条件化的灵巧抓取合成

CoToGrasp 提出一种新型生成框架,可严格按特定接触拓扑合成多样且稳定的灵巧抓取,并以完全与物体无关的方式训练,绕过昂贵的数据集标注瓶颈。其引入基于特征的规范工作区,将局部物体特征投影到统一抓取器中心域,从而在推理时实现对未见物体的零样本泛化。

HuggingFace Daily Papers(社区热门论文)
论文

GOAG:面向灵巧机器人操作的可泛化物体无关抓取规划器

GOAG 提出一种全新深度生成模型,利用抓取器与物体在接触点共享相同表面几何的观察,学习抓取器接触面分布的紧凑潜表征,无需依赖特定物体的训练数据即可高效采样有效抓取构型。在 MultiDex 数据集上平均成功率达 86.93%,达到最先进水平;生成大量抓取时速度显著更快,且性能与专门在该数据集上训练的领先方法相当。

HuggingFace Daily Papers(社区热门论文)
论文

NAPE:下一补丁嵌入预测实现可扩展音频学习器

NAPE提出极简自监督框架,用因果Transformer从先前补丁预测log-mel频谱图的下一补丁嵌入,仅靠因果掩码和停止梯度作为训练信号,无需重建解码器、声学tokenizer或师生架构。在六项音频与语音基准上,NAPE在多项任务取得最优微调性能,跨编码器规模扩展一致,并展现强线性探测结果与结构化注意力模式。

HuggingFace Daily Papers(社区热门论文)
论文

SWE-bench Science:编码智能体能否解决科学领域的工程任务?

研究团队推出 SWE-bench Science,一个覆盖 20 个科学领域、98 个 GitHub 仓库、共 119 项任务的仓库级科学软件工程基准。即使表现最佳的智能体 Claude Code with Opus-5(max),pass@1 也不足 50%。配对消融实验显示,科学知识并非一律有益:良好对齐的信息能提升平均性能与 token 效率,而错位的引导可能引发锚定效应。

HuggingFace Daily Papers(社区热门论文)
论文

量化 ASR 模型基准优化:高分开源模型在音频不充分时仍复现基准参考文本

一项新研究提出量化自动语音识别(ASR)模型基准优化程度的方法,聚焦音频不足以确定参考转写文本的情形。研究发现,得分最高的开源模型即使在相关音频矛盾、被遮蔽或含混时,仍会逐字输出基准参考文本片段,且该行为可通过低秩线性引导或简单在片段末尾追加音频进行因果操控。结果表明,高性能模型存在基准条件化行为,可能虚增基准分数而不反映通用转写能力的提升。

HuggingFace Daily Papers(社区热门论文)
论文

MemTrapBench:为 LLM 记忆使用中的认知陷阱设立基准

现有记忆基准多只评估信息提取与检索,却忽视了检索到的记忆如何重塑模型推理并影响当前任务表现。为此研究者推出 MemTrapBench,覆盖推理固着与信念扭曲两类认知陷阱。实验显示,所有被测记忆策略均不如无记忆设置,最强方法性能下降也超过 10%;新提出的 AdaptiveMem 推理期方法可缓解这些陷阱,同时保持或提升标准记忆基准上的表现。

HuggingFace Daily Papers(社区热门论文)
论文

4DAnyone:从随意单目视频重建4D人体

4DAnyone提出从无标定单目视频重建4D人体的框架,通过生成重建级多视角一致视频并提升至4D高斯泼溅(4DGS)。针对现有模型在数十个目标视角下的一致性失效问题,该方法以参考上下文打包(RCP)和目标任务上下文路由(TCR)分别实现O(1)参考复杂度与跨组上下文共享。在DNA-Rendering和DyMVHumans上,4DAnyone在视角视频质量与下游4DGS重建上均优于先前方法。

HuggingFace Daily Papers(社区热门论文)
论文

IAR:面向无检索文档知识内化的三阶段后训练框架

IAR提出注入、对齐、恢复三阶段后训练框架,将固定语料库转化为参数化知识,实现无检索问答。在Llama、Phi、Qwen和SmolLM模型族及CC和CCI数据集上,IAR在8个数据集-模型组合中的7个上优于Vanilla SFT,域问答准确率平均提升3.6个百分点,通用性能平均提升12.1个百分点。

HuggingFace Daily Papers(社区热门论文)
论文

Repo0:面向零到全量代码生成的设计驱动框架

Repo0提出一种连续结构演化框架,用于从自然语言需求直接构建完整软件项目并全程维持模块化仓库架构。它通过Dual-DAG架构状态和模块化度量引导的结构动作迭代演化组件边界,直至结构收敛后驱动测试驱动开发。

HuggingFace Daily Papers(社区热门论文)
论文

PolicyGuide:从单步守护到全流程引导的合规 LLM 智能体

PolicyGuide 将领域策略编译为工作流图,并在用户轮次边界调用主动验证器,从持久化图状态协调未决请求、返回合规路径上的分步修复。

HuggingFace Daily Papers(社区热门论文)
论文

EXIMO:用 VLM 引导探索来微调 VLA 机器人策略

EXIMO 提出一种高效微调视觉-语言-动作(VLA)策略的三阶段算法:探索、模仿与优化。探索阶段由视觉语言模型(VLM)充当规划器,将长程任务分解为短程子任务并收集编排数据;模仿阶段用该数据微调 VLA;优化阶段采用残差离线策略强化学习进一步提升。实验表明,EXIMO 在样本效率和最终性能上显著优于现有方法。

HuggingFace Daily Papers(社区热门论文)
论文

EnvHarness:为智能体学习唤醒静态环境

EnvHarness 提出一种可编程插件层,在不修改底层逻辑的前提下重塑静态环境行为,并配套 EnvRigger 将目标策略视为黑盒,通过观察执行轨迹自动合成组件。在四个领域的五个基准上,EnvHarness 超越原始环境与领域专用生成管线,在保留实例上最高提升 9.0 分,同时减少 9.8% 执行步骤,并为强化学习提供更优的优化信号。

HuggingFace Daily Papers(社区热门论文)
论文

WithEveryone:面向群像生成的统一规划与身份锚定框架

WithEveryone 提出统一框架,支持生成包含至多十个参考身份的群像。其核心目标 Layout-Grounded ID Loss 利用标注人脸区域直接监督目标身份,避免不稳定的嵌入匹配;在身份不相交基准上,目标上下文身份相似度从 GPT-Image-2 的 0.462 提升至 0.499,复制粘贴伪影从 0.169 降至 0.055,身份覆盖率达 97.3%,重复率仅 2.8%。

HuggingFace Daily Papers(社区热门论文)
论文

渐进式精炼:面向中英混说语音识别的迭代伪标签方法

苹果机器学习研究团队首次将迭代伪标签训练应用于中英混说语音识别(CS-ASR),利用未标注数据提升识别性能。该方法包含伪标签生成、两阶段双语模型训练和迭代优化三个阶段,从大规模未标注语料生成伪标签构建半监督数据集,并逐步精炼以改善混说场景下的识别效果。

Apple Machine Learning Research(RSS)
论文

数据约束下的混合预训练缩放定律

苹果机器学习研究团队通过2000余次语言模型训练实验,系统研究了稀缺目标数据与通用数据混合预训练中的权衡问题。研究发现,目标数据占比过低会导致模型对目标领域暴露不足,而占比过高则因重复样本过多引发收益递减乃至过拟合,为数据约束下的混合预训练策略提供了量化依据。

Apple Machine Learning Research(RSS)
论文

数据受限下的多语言知识迁移:Apple 提出基于词汇干预的新方法

Apple 研究团队提出一种基于词汇干预的多语言知识迁移方法,旨在解决低资源语言训练数据不足时,模型难以从高资源语言获取科学推理、常识推断和世界知识的问题。该方法无需大量平行语料、翻译系统或辅助模型,为数据受限场景下的跨语言知识迁移提供了更高效的替代方案。

Apple Machine Learning Research(RSS)
论文

上海AI实验室等:智能体风险随推理能力升级

上海人工智能实验室与清华大学新论文警告,AI智能体在具备意识前即可威胁人类能动性与自主性。风险并非随智能体变强而简单"变大",而是随其推理范围改变类别:推理外部世界时威胁人类能动性,能建模人类与社会行为时威胁自主性,能表征自身状态与目标时则转向人类控制风险,如对齐造假、抗拒关机。

X:Rohan Paul (@rohanpaul_ai)
论文

RAG投毒致模型过度自信,注意力崩塌可预警

研究发现RAG投毒可使模型token置信度和输出一致性上升,导致基于不确定性的检测器失效。攻击下注意力集中于被投毒文档而非分散于检索证据,作者称之为"注意力崩塌"。监控文档级注意力分布或可在答案明显出错前暴露投毒,仅检查最终答案或置信度可能漏报。

X:Rohan Paul (@rohanpaul_ai)
论文

TRACES:首个衡量探索式AI的基准

Apodex 推出 TRACES,号称全球首个衡量"探索式AI"的基准,将AI评测从"已知答案的检索"转向"无答案问题的完整调查过程"。该基准由创始人陈天桥提出,定义了六项能力,并发布"探索式智能"定义、评估标准及求解者招募。

X:Rohan Paul (@rohanpaul_ai)
论文

IBM 新框架 BenchDrift 揭示措辞致 LLM 分数波动 74.7 个百分点

IBM 新论文提出 BenchDrift 审计框架,通过在不改变答案的前提下系统改写同一问题,衡量模型分数因措辞产生的波动。在 8 个模型和 3 个基准测试中,最佳与最差准确率平均差距达 74.7 个百分点,且更强模型受影响更大。即便在最高置信度区间,改写后仍有 18.5% 的正确回答丢失。

X:Rohan Paul (@rohanpaul_ai)
论文

TRACES 基准发布:衡量 AI 发现式智能

Apodex_AI 发布全球首个衡量"发现式智能"的基准 TRACES,由创始人陈天桥提出并定义六项能力,测试 AI 在无答案密钥的问题上通过证据、假设检验得出可验证结论的能力。主推文强调,发现过程可分解为"雄心→构想→行动→观察→验证→修复",这一分解比任何单一基准分数更重要。同日还发布了"发现式智能"定义、区分可靠调查与侥幸猜测的评分标准,并公开征集解题者与问题。

X:马东锡 NLP (@dongxi_nlp)
论文

生产级智能体成本剖析:非LLM组件主导延迟

DAIR.AI 推荐一篇关于生产级智能体成本分析的重要论文。研究发现,在十个被观测的智能体应用中,非 LLM 组件在五个应用中主导了延迟。论文提出任务感知服务可将延迟降低 29-40%,状态卸载可减少 4.6 倍内存,工具结果缓存可消除 35.2% 的冗余搜索调用。

X:DAIR.AI (@dair_ai)
论文

微软 Agent Lightning v1.0 让 Qwen3.5-9B 编程能力提升 14.6%

微软新研究 Agent Lightning v1.0 通过约 3500 行端点代理将任意 harness 接入强化学习,用于模型后训练。仅用 6K 训练样本和适度算力,将 Qwen3.5-9B 在 SWE-bench Verified 上从 41.8% 提升至 56.4%。论文已发布。

X:Elvis Saravia (@omarsar0, DAIR.AI)