布丁软件

AI 资讯

每日 AI 精选与日报

大模型、AI 产品、行业动态、论文与实用技巧,内容由 AIHOT 实时聚合;可访问来源支持直达原文。

🧩
AI 技能模板40+ 套 AI 技能模板与 Agent 工作流,覆盖办公写作、自媒体创作等场景
AI 模型

DeepSeek 发布实验性视觉模型 V4-Flash-Vision-Exp,智能体基准测试对标 Opus 4.8

DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp,在图像理解基础上保持文本推理能力,其内部智能体基准测试成绩接近 Opus 4.8。该模型兼容 OpenAI 与 Anthropic API,支持 Base64、URL(32 MiB)及免费 Files API(64 MiB)三种传图方式,单图成本最高 384 tokens,单次请求最多 600 张图片。

The Decoder:AI News(RSS)
AI 模型

GLM 5.3 Flash 疑现身,加速竞赛开启

据 @synthwavedd 爆料,OpenRouter 上的神秘模型 "Ox Alpha" 疑为即将推出的 GLM 5.3 Flash。若属实,这款 Flash 模型性能将超越 Fable 和 GPT Sol 等顶级模型,zAI 的后训练能力令西方模型相形见绌。Kimi k3.1 或也将发布,行业加速竞赛一触即发。

X:Kim (@kimmonismus)
AI 模型

TARS 发布 AWE 3.5 具身原生基础模型

TARS 推出具身原生基础模型 AWE 3.5,采用"Born as One"架构,将动作、感知、几何与触觉整合进单一模型,而非后期拼接。该模型支持数分钟长时程闭环推理,任务执行效率约为 PI0.5 的 2 倍,并通过预训练双先验与后训练世界引擎滚动预测来优化决策。

X:Rohan Paul (@rohanpaul_ai)
AI 模型

蚂蚁百灵开源Ling-3.0-flash-dspark草稿模型

今天我们开源了 Ling-3.0-flash-dspark,这是一个专为 Ling-3.0-flash 构建的 DSpark 草稿模型。在 4 块 NVIDIA Blackwell GPU 上,batch 为 1 时,它在 1,000 个请求中实现了 1,120 tok/s 的吞吐量、0.78 ms 的平均 TPOT,以及 9.95 的接受长度。🧵

X:蚂蚁百灵 (@AntLingAGI)
AI 模型

GLM 5.3 Flash 疑现身 OpenRouter,Kimi K3.1 亦在测试

据 @synthwavedd,OpenRouter 上的神秘模型"Ox Alpha"实为智谱即将推出的 GLM 5.3 Flash。若属实,该 Flash 模型性能或超越 Fable、GPT Sol 等顶级模型,zAI 的后训练能力将令西方模型相形见绌。此外,Kimi K3.1 也疑似以"korrine"代号在 Code Arena 测试。

X:Kim (@kimmonismus)
AI 模型

Runway Ruby 发布,SDR 视频转 16 位 HDR

推出 Runway Ruby。 一款新模型,可将 SDR 视频转换为 ProRes 和 EXR 序列中的 16 位 HDR。兼容任何已上传的视频或生成的输出,最长 30 秒。

X:Runway (@runwayml)
AI 模型

DeepSeek-V4-Flash-Vision-Exp 发布,多模态智能体性能逼近 Opus-4.8

DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台,文本能力与 V4-Flash 持平,多模态智能体基准测试大幅跃升,性能接近 Opus-4.8。Ox Alpha 支持 1M token 上下文,可处理文本、图像和视频输入,在编码与智能体任务中表现出色。DeepSeek Harness 0.1.1 同步发布,开箱支持新模型。

X:Elvis Saravia (@omarsar0, DAIR.AI)
AI 模型

谷歌神秘模型Ox Alpha免费开放一周

这么好的模型,竟然没人猜它是谷歌的 【引用 @opencode】:Ox Alpha(隐身模型)接下来一周免费使用 - 1M 上下文窗口 - 多模态 - 零数据留存 慷慨的速率限制,近乎无限使用 我们每天可处理 100T token 的容量,看看你能用它做什么

X:阿易 AI Notes (@AYi_AInotes)
AI 模型

面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型

面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。

X:面壁智能 OpenBMB (@OpenBMB)
AI 模型

DeepSeek V4 Flash Vision 上线 OpenRouter

DeepSeek V4 Flash Vision Exp 已在 OpenRouter 上线! @deepseek_ai 的新模型支持图像输入,定价与 V4 Flash 相同,在文本智能体基准测试中与 V4 Flash 0731 持平,并在 Agents' Last Exam 和 ZeroBench 上超越 Opus-4.8。 立即使用:https://openrouter.ai/deepseek/deepseek-v4-flash-vision-exp

X:OpenRouter (@OpenRouter)
AI 模型

DeepSeek-v4-flash-vision-exp 发布:支持图像与文本多模态输入

DeepSeek 推出 DeepSeek-v4-flash-vision-exp 模型,可同时接受图像与文本输入。用户能要求模型描述图片、从截图中读取文字、分析图表等。该实验版本扩展了 DeepSeek 的多模态能力。

Hacker News 热门(buzzing.cc 中文翻译)
AI 模型

DeepSeek-V4-Flash-Vision-Exp 上线,网友喊话降价

DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp,文本能力对标 V4-Flash,多模态智能体基准大幅跃升,性能接近 Opus-4.8。模型已上线 API 平台,可用 model='deepseek-v4-flash-vision-exp' 调用,同日发布 DeepSeek Harness 0.1.1 支持新模型。网友 @梁子 借新模型上线之际,呼吁官方降价。

X:小北 (@frxiaobei)
AI 模型

DeepSeek多模态模型上线,百张图成本不足20美分

DeepSeek 发布实验性多模态模型 deepseek-v4-flash-vision-exp,文本能力对齐 V4-Flash,多模态 Agent 性能逼近 Opus-4.8,Agents Last Exam 27.3 对 25.7、ZeroBench 35.0 对 34.0。

X:阿易 AI Notes (@AYi_AInotes)
AI 模型

DeepSeek 发布 V4-Flash-Vision-Exp 多模态模型

DeepSeek 推出实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,面向需要视觉能力的智能体,已在 DeepSeek API 平台上线。

X:Kim (@kimmonismus)
AI 模型

DeepSeek 发布 V4-Flash-Vision-Exp 多模态模型

DeepSeek 在 API 平台上线多模态模型 deepseek-v4-flash-vision-exp,文本性能接近 Opus 4.8 并持平 DeepSeek-V4-Flash。

X:Testing Catalog (@testingcatalog)
AI 模型

DeepSeek-V4-Flash-Vision-Exp 发布

DeepSeek 上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,可通过设置 model='deepseek-v4-flash-vision-exp' 在 API 平台访问。

DeepSeek:API 更新日志
AI 模型

DeepSeek V4-Flash-Vision-Exp 上线,开启多模态 API 服务

深度求索发布多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,已上线 API 平台。该模型纯文本能力与 V4-Flash 正式版持平,视觉理解 Agent Benchmark 表现大幅跃升,接近 Opus-4.8。API 按 token 计费,单张图片最多占 384 tokens,价格与 V4-Flash 一致,支持三种调用格式及三种图片传入方式。

IT之家(RSS)
AI 模型

DeepSeek-V4-Flash-Vision-Exp 多模态模型上线

DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台,文本能力与 V4-Flash 持平,多模态智能体性能大幅跃升,接近 Opus-4.8。DeepSeek Harness 0.1.1 同步发布,开箱即支持新模型,可用 model='deepseek-v4-flash-vision-exp' 调用。

X:Tianyi Cui(@tianyi)
AI 模型

DeepSeek 发布 V4-Flash-Vision-Exp 多模态模型

DeepSeek 推出实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,文本能力与 V4-Flash 持平,涵盖智能体、推理与世界知识。

X:DeepSeek (@deepseek_ai)
AI 模型

神秘新模型Ox Alpha现身:1M上下文免费一周

神秘新AI模型Ox Alpha悄然上线,提供1M上下文窗口、多模态能力、零数据保留,并在一周内近乎无限量免费使用。OpenCode称其每日可处理100万亿token(约每秒11.6亿token),但该模型的开发公司身份尚未公开。

X:Kim (@kimmonismus)
AI 模型

腾讯混元翻译模型上线OpenRouter

我们的翻译模型现已上线 @OpenRouterAI 🌐 • Hy-MT2-1.8B • Hy-MT2-30B-A3B 专为覆盖 33 种语言的真实场景翻译而构建,具备强大的多语言指令跟随能力,适用于结构化、上下文相关及风格引导型任务。 快来试试吧 ↓ https://openrouter.ai/tencent

X:腾讯混元 (@TencentHunyuan)
AI 模型

Ox Alpha 发布:面向编码与智能体任务的免费推理模型

Ox Alpha 是一款面向编码、持续性智能体工作和生产负载的推理模型,现已免费开放使用。该模型支持 1,048,576 token 的上下文窗口,最大输出 131,072 token。

Hacker News 热门(buzzing.cc 中文翻译)
AI 模型

商汤开源 8B 参数多模态大模型 SenseNova U1.5 Lite,原生支持 4K 图像输出

商汤科技今日宣布开源轻量级原生统一多模态大模型 SenseNova U1.5 Lite,该模型拥有 8B 参数,原生支持 3-4k 上下文长度和 4K 高分辨率图像输出。模型支持 Bounding Box、Visual Marker 及多图参考等精细视觉控制,在指令遵循与图像编辑保持度上超越同量级模型,文字渲染与复杂布局能力媲美超大规模商业模型。

IT之家(RSS)
AI 模型

蚂蚁百灵开源 Ling-3.0-tiny / flash Base 模型,开放训练过程关键节点

蚂蚁百灵正式开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base,除最终 Base checkpoint 外,还同步开放预训练和中期训练的权重 checkpoint,共计 6 个。

IT之家(RSS)
AI 模型

Superwhisper 发布 462MB 开源文本规范化模型 S1-mini

Superwhisper 推出 S1 系列,其中 S1-mini 以开源权重发布在 Hugging Face 上。这是一款 0.6B 参数的文本规范化模型,基于 Qwen3-0.6B 微调,用于清理语音识别后的转录文本,去除填充词并应用标点与大小写。

MarkTechPost(RSS)
AI 模型

阿里 Qwen-Image-3.0-Pro 登顶图像编辑榜第六

阿里发布第三代图像模型 Qwen-Image-3.0 系列,旗舰版 Pro 在 Artificial Analysis 图像编辑榜位列第六、文生图榜第九,较上代分别提升 83 和 48 Elo 分。该系列支持 4.5k token 提示词、10 像素级精确文字渲染及 12 种语言,Pro 版定价 $0.04/张(1K 分辨率),已在阿里云 Model Studio 上线。

X:Artificial Analysis (@ArtificialAnlys)
AI 模型

OpenRouter 上线 Ox Alpha 隐身模型

🥷 新隐身模型:Ox Alpha Ox Alpha 是一款前沿模型,专为高效编码、持续智能体工作及实际生产环境使用而构建。 - 1M token 上下文窗口 - 支持文本、图像和视频输入 立即试用并分享反馈以改进模型!https://openrouter.ai/stealth/ox-alpha

X:OpenRouter (@OpenRouter)
AI 模型

Ox Alpha 隐身模型免费开放一周

Ox Alpha(隐身模型)接下来一周免费使用 - 1M 上下文 - 多模态 - 零数据留存 慷慨的速率限制,近乎无限使用 我们每天有 100T token 的处理能力,看看你能做到什么

X:opencode (@opencode)
AI 模型

Liquid AI 发布 LFM2.5-DSpark 草稿模型,解码速度最高提升 3.18 倍且输出不变

Liquid AI 为 LFM2.5 系列三款模型(1.2B-Instruct、2.6B、8B-A1B)发布 DSpark 草稿模型检查点,通过约 300M 参数的草稿模型一次提出 9 个候选 token,由目标模型单次前向验证,在 H100 上解码速度最高提升 3.18 倍,M4 Max MacBook Pro 上最高 2.87 倍。

MarkTechPost(RSS)
AI 模型

DiffusionGemma 技术报告:Google DeepMind 开源离散扩散模型,单卡 H100 每秒生成约 1500 token

Google DeepMind 推出 DiffusionGemma,一个基于 Gemma 4 26B A4B MoE 模型微调而来的实验性开放权重文本扩散模型。

Hacker News 热门(buzzing.cc 中文翻译)
AI 模型

SenseNova U1.5 Lite 开源:8B 原生统一多模态模型

SenseNova 发布 U1.5 Lite,一个 8B 参数的开源轻量级原生统一多模态模型,可同时完成视觉理解、生成与编辑。该模型通过 OPD 将任务专家能力蒸馏进单一模型,推理时无需路由或切换专家,并支持原生 4K 生成、复杂指令遵循及本地编辑。其在指令遵循和编辑保持上超越同尺寸模型,文本渲染与复杂布局上可媲美大型商业模型。

X:Rohan Paul (@rohanpaul_ai)
AI 模型

Meta 发布 Muse Spark 1.2 多模态评测与演示

Meta 发布 Muse Spark 1.2 新评测与演示,展示其多模态能力广度,涵盖视觉转代码、感知转物理动作及音视频理解。演示中,模型解析多模态观察并调用工具,引导机器人在非结构化环境中导航寻找橡皮鸭。

X:AI at Meta (@AIatMeta)
AI 模型

Muse Spark 1.2 多模态模型能力解析

1/ Muse Spark 1.2 是一个非常强大的多模态模型--它能够进行视觉编码、机器人规划以及音视频理解,这些能力通过智能体工具整合在一起。

X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)
AI 模型

商汤开源 SenseNova U1.5 Lite 轻量多模态模型

商汤发布开源轻量级原生统一多模态模型 SenseNova U1.5 Lite,仅 8B 参数,支持视觉理解、生成与编辑。该模型主打原生 4K 生成、复杂指令跟随、中英文文本渲染及多图参考编辑,在指令跟随和编辑保持上超越同尺寸模型,文本渲染与复杂布局上比肩大型商业模型。

X:商汤 SenseTime (@SenseTime_AI)
AI 模型

Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。

Hugging Face:Blog(RSS)
AI 模型

Harvey 推出首个法律专用后训练模型 Tenet

Harvey 推出首个法律专用后训练模型 Tenet,基于 Kimi K3 底座与 FireworksAI 合作训练。相比底座,Tenet 在 LAB 上全通过率提升 82%、LAB Contracts 提升 22%,后者达 SOTA 并位居 LAB 第二,推理成本低于主流基础模型的四分之一。

X:Elvis Saravia (@omarsar0, DAIR.AI)
AI 模型

微软 Skala 1.1 更新提升计算化学精度

Skala 1.1,微软研究院更新的深度学习交换关联泛函,提供了更高的精度、在计算化学生态系统中更广泛的可及性,以及一个用于跟踪计算性能的活基准。https://msft.it/6016aMXZn

X:Microsoft Research (@MSFTResearch)
AI 模型

Sakana Translateの翻訳モデルを新しい世代の「Sakana Namazu」へアップデート

Sakana AI:Blog(网页)
AI 模型

dots3-note 预览版:长任务自评模型

dots3-note 预览版是一个开放权重模型,专为运行数小时、有时甚至数天的任务而构建。 → 280B 总参数 / 16B 激活参数 → 512K 上下文 → 文本、视觉和语音 → 推理、编码和工具使用 但最有趣的部分不是模型规模。 而是模型如何在长任务完成之前学会评估自身进展。🧵

X:Elvis Saravia (@omarsar0, DAIR.AI)
AI 模型

GEN-1.5:通用型 AI 仅凭单次演示教会机器人新任务

机器人初创公司 Generalist AI 发布 GEN-1.5,该模型可将 3 至 12 秒的演示作为"物理提示词"载入上下文窗口,让机器人无需训练即可执行任务。在开罐、取钱等十项测试中,平均成功率为 59%;用五分钟数据训练十步后,成功率升至 83%。模型还能串联两个提示词、使用仿真演示并部分模仿人类手部动作,但所有结果均出自公司自身,未经独立验证。

The Decoder:AI News(RSS)
AI 模型

Anthropic 内部运行未发布模型"Model 2",性能超越所有公开版 Claude

Anthropic 在内部运行一款未发布的 AI 模型"Model 2",其综合性能略强于 Claude Mythos 5,但在某些领域较弱。据该公司 2026 年 8 月的风险报告,该模型在内部能力指数 AECI 上比 Mythos 5 高约 1.5 点,提升幅度小于从 Mythos Preview 到 Mythos 5 的跃升。该模型主要用于内部编码、数据生成及研究与工程,目前无外部发布计划。

The Decoder:AI News(RSS)
AI 模型

阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕

阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。

IT之家(RSS)
AI 模型

Ornith-1.5 系列开源模型发布:397B 版性能媲美 Claude Opus 4.8,量化版可运行于 iPhone 17

DeepReinforce 推出 Ornith-1.5 系列开源模型,训练中引入"自我改进循环"机制。其中最大 Ornith-1.5-397B 采用 MoE 架构,总参数 3970 亿,性能媲美并在部分测试中超过 Claude Opus 4.8;另有 35B-A3B 与 9B 两个规模,9B 的量化版 Ornith-1.5-9B-Mobile 可在安卓手机及 iPhone 17 上运行。

IT之家(RSS)
AI 模型

Meta Muse Video 生成视频样片曝光,单次 AI 最长生成 10 秒视频

Meta 即将推出 Muse Video 模型,已邀请部分合作伙伴 Beta 测试,单次可生成最长 10 秒视频。测试样片显示其在细节呈现、场景物体关系理解及时间维度稳定性上潜力较高,但 Meta 承认音频与画面同步不足,高速运动物理准确性有差距。现有 10 秒样本尚不足以验证更长叙事、复杂角色一致性或高强度动作场景表现。

IT之家(RSS)
AI 模型

Meta AI 视频模型 Muse 首批输出曝光

独家 🔥:抢先看 Meta AI 的 Muse 视频模型首批输出。 > Muse 视频目前正处于封闭测试阶段。 > 该模型对受版权保护的内容已相当严格限制。 > 原生音频支持语音和音乐,开箱即用。 如果该模型最终免费开放到 Meta 各产品中,将是一记重拳。 有什么提示词值得我试试吗?👀

X:Testing Catalog (@testingcatalog)
AI 模型

猜猜未发布模型?赛博朋克测试图引热议

猜猜是哪个模型?(未发布,当然)👀 测试提示词:"赛博朋克黑客机器人在多台显示器前工作"

X:Testing Catalog (@testingcatalog)
AI 模型

GEN-1.5 发布:秒级学习新任务的一次性学习者

推出 GEN-1.5,一个一次性学习者。 它能在几秒内学会新任务。向它展示要做什么,它便能泛化。 这一能力源于在大规模物理数据上的预训练,是迈向为物理世界构建通用智能这一使命的一步。

X:Generalist (@GeneralistAI)
AI 模型

Cohere 本地托管 S1-mini 开源模型

本地托管 🤝🇨🇦 本地制造

X:Cohere(@cohere)
AI 模型

OpenCode Go 推出 Muse Spark 1.2 Contributor

Muse Spark 1.2 Contributor 现已在 OpenCode Go 上可用 该模型将基于你的数据进行训练,因此需要明确选择加入,并在某些地区受到限制 作为交换,你将获得极高的使用额度

X:opencode (@opencode)
AI 模型

Ornith-1.5:从自我构建到自我优化

Ornith-1.5 发布,将 Ornith-1.0 的自我构建框架扩展为完整自我优化闭环:模型自主提出任务、生成任务专属脚手架并产出解决方案用于强化学习。

Hacker News 热门(buzzing.cc 中文翻译)