布丁软件

AI 资讯

每日 AI 精选与日报

大模型、AI 产品、行业动态、论文与实用技巧,内容由 AIHOT 实时聚合;可访问来源支持直达原文。

🧩
AI 技能模板40+ 套 AI 技能模板与 Agent 工作流,覆盖办公写作、自媒体创作等场景
AI 模型

神秘模型Ox Alpha登顶编程榜,@weidai11警告AI接管或已开始

神秘模型Ox Alpha在OpenRouter上击败Fable和Sol登顶编程榜,却无人知晓其开发者。该模型拥有1M token上下文窗口,支持文本、图像和视频输入,免费一周,日处理能力达100万亿token,在DeepSWE子集上得分80%。

X:AI Safety Memes (@AISafetyMemes)
AI 模型

Gemini 3.7 成增长最快模型发布

Gemini 3.7 是我们迄今为止增长最快的模型发布,看到大家的反响真是太棒了!!!

X:Logan Kilpatrick (@OfficialLoganK)
AI 模型

Gemini 3.7 Flash首周破增长纪录

Gemini 3.7 Flash 在发布首周便打破了此前 Gemini 的增长纪录,成为我们迄今增长最快的模型。很高兴看到开发者社区的热情!现在它也已在 Search 和 @Geminiapp 中运行。

X:Sundar Pichai (@sundarpichai)
AI 模型

Ox Alpha 单次生成完整 Three.js 3D 世界

Ox Alpha 在一次提示下生成 64,745 个输出 token,单次响应产出完整 Three.js dreamcore 3D 场景的全部程序化代码,无需外部素材。该模型支持 1M 上下文窗口、约 131k 最大输出 token,可处理文本+图像+视频输入并输出文本,定位为面向编码、长程智能体软件工程及生产负载的推理模型。aimlapi 正免费提供 Ox Alpha。

X:Rohan Paul (@rohanpaul_ai)
AI 模型

Marin 535B-A23B 启动训练,全程开源

Marin 535B-A23B 本周启动训练,全程开源。计划在 11 台 GB200 NVL72 上以 18.75T tokens 训练约 3 个月(2.7e24 FLOPs),其中预训练占 80%、中期训练占 20%,后续将进行后训练。团队此前已用 1.6B-A61M 至 27.7B-A1.2B 的四级缩放阶梯验证并预测主运行表现。

X:Nathan Lambert (@natolambert)
AI 模型

Meta Muse Spark 1.2 上线 OpenRouter

Meta 的 Muse Spark 1.2 contributor 版本现已上线 OpenRouter,输入 $0.10/M、输出 $0.20/M。该版本以低于 GPT-5.6 Luna 的价格提供 GPT-5.6 Terra 的性能,但 contributor 模式意味着提示词和输出可能被用于改进 Meta 产品。

X:Testing Catalog (@testingcatalog)
AI 模型

DeepSeek 发布实验性视觉模型 V4-Flash-Vision-Exp,智能体基准测试对标 Opus 4.8

DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp,在图像理解基础上保持文本推理能力,其内部智能体基准测试成绩接近 Opus 4.8。该模型兼容 OpenAI 与 Anthropic API,支持 Base64、URL(32 MiB)及免费 Files API(64 MiB)三种传图方式,单图成本最高 384 tokens,单次请求最多 600 张图片。

The Decoder:AI News(RSS)
AI 模型

GLM 5.3 Flash 疑现身,加速竞赛开启

据 @synthwavedd 爆料,OpenRouter 上的神秘模型 "Ox Alpha" 疑为即将推出的 GLM 5.3 Flash。若属实,这款 Flash 模型性能将超越 Fable 和 GPT Sol 等顶级模型,zAI 的后训练能力令西方模型相形见绌。Kimi k3.1 或也将发布,行业加速竞赛一触即发。

X:Kim (@kimmonismus)
AI 模型

TARS 发布 AWE 3.5 具身原生基础模型

TARS 推出具身原生基础模型 AWE 3.5,采用"Born as One"架构,将动作、感知、几何与触觉整合进单一模型,而非后期拼接。该模型支持数分钟长时程闭环推理,任务执行效率约为 PI0.5 的 2 倍,并通过预训练双先验与后训练世界引擎滚动预测来优化决策。

X:Rohan Paul (@rohanpaul_ai)
AI 模型

蚂蚁百灵开源Ling-3.0-flash-dspark草稿模型

今天我们开源了 Ling-3.0-flash-dspark,这是一个专为 Ling-3.0-flash 构建的 DSpark 草稿模型。在 4 块 NVIDIA Blackwell GPU 上,batch 为 1 时,它在 1,000 个请求中实现了 1,120 tok/s 的吞吐量、0.78 ms 的平均 TPOT,以及 9.95 的接受长度。🧵

X:蚂蚁百灵 (@AntLingAGI)
AI 模型

GLM 5.3 Flash 疑现身 OpenRouter,Kimi K3.1 亦在测试

据 @synthwavedd,OpenRouter 上的神秘模型"Ox Alpha"实为智谱即将推出的 GLM 5.3 Flash。若属实,该 Flash 模型性能或超越 Fable、GPT Sol 等顶级模型,zAI 的后训练能力将令西方模型相形见绌。此外,Kimi K3.1 也疑似以"korrine"代号在 Code Arena 测试。

X:Kim (@kimmonismus)
AI 模型

Runway Ruby 发布,SDR 视频转 16 位 HDR

推出 Runway Ruby。 一款新模型,可将 SDR 视频转换为 ProRes 和 EXR 序列中的 16 位 HDR。兼容任何已上传的视频或生成的输出,最长 30 秒。

X:Runway (@runwayml)
AI 模型

DeepSeek-V4-Flash-Vision-Exp 发布,多模态智能体性能逼近 Opus-4.8

DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台,文本能力与 V4-Flash 持平,多模态智能体基准测试大幅跃升,性能接近 Opus-4.8。Ox Alpha 支持 1M token 上下文,可处理文本、图像和视频输入,在编码与智能体任务中表现出色。DeepSeek Harness 0.1.1 同步发布,开箱支持新模型。

X:Elvis Saravia (@omarsar0, DAIR.AI)
AI 模型

谷歌神秘模型Ox Alpha免费开放一周

这么好的模型,竟然没人猜它是谷歌的 【引用 @opencode】:Ox Alpha(隐身模型)接下来一周免费使用 - 1M 上下文窗口 - 多模态 - 零数据留存 慷慨的速率限制,近乎无限使用 我们每天可处理 100T token 的容量,看看你能用它做什么

X:阿易 AI Notes (@AYi_AInotes)
AI 模型

面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型

面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。

X:面壁智能 OpenBMB (@OpenBMB)
AI 模型

DeepSeek V4 Flash Vision 上线 OpenRouter

DeepSeek V4 Flash Vision Exp 已在 OpenRouter 上线! @deepseek_ai 的新模型支持图像输入,定价与 V4 Flash 相同,在文本智能体基准测试中与 V4 Flash 0731 持平,并在 Agents' Last Exam 和 ZeroBench 上超越 Opus-4.8。 立即使用:https://openrouter.ai/deepseek/deepseek-v4-flash-vision-exp

X:OpenRouter (@OpenRouter)
AI 模型

DeepSeek-v4-flash-vision-exp 发布:支持图像与文本多模态输入

DeepSeek 推出 DeepSeek-v4-flash-vision-exp 模型,可同时接受图像与文本输入。用户能要求模型描述图片、从截图中读取文字、分析图表等。该实验版本扩展了 DeepSeek 的多模态能力。

Hacker News 热门(buzzing.cc 中文翻译)
AI 模型

DeepSeek-V4-Flash-Vision-Exp 上线,网友喊话降价

DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp,文本能力对标 V4-Flash,多模态智能体基准大幅跃升,性能接近 Opus-4.8。模型已上线 API 平台,可用 model='deepseek-v4-flash-vision-exp' 调用,同日发布 DeepSeek Harness 0.1.1 支持新模型。网友 @梁子 借新模型上线之际,呼吁官方降价。

X:小北 (@frxiaobei)
AI 模型

DeepSeek多模态模型上线,百张图成本不足20美分

DeepSeek 发布实验性多模态模型 deepseek-v4-flash-vision-exp,文本能力对齐 V4-Flash,多模态 Agent 性能逼近 Opus-4.8,Agents Last Exam 27.3 对 25.7、ZeroBench 35.0 对 34.0。

X:阿易 AI Notes (@AYi_AInotes)
AI 模型

DeepSeek 发布 V4-Flash-Vision-Exp 多模态模型

DeepSeek 推出实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,面向需要视觉能力的智能体,已在 DeepSeek API 平台上线。

X:Kim (@kimmonismus)
AI 模型

DeepSeek 发布 V4-Flash-Vision-Exp 多模态模型

DeepSeek 在 API 平台上线多模态模型 deepseek-v4-flash-vision-exp,文本性能接近 Opus 4.8 并持平 DeepSeek-V4-Flash。

X:Testing Catalog (@testingcatalog)
AI 模型

DeepSeek-V4-Flash-Vision-Exp 发布

DeepSeek 上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,可通过设置 model='deepseek-v4-flash-vision-exp' 在 API 平台访问。

DeepSeek:API 更新日志
AI 模型

DeepSeek V4-Flash-Vision-Exp 上线,开启多模态 API 服务

深度求索发布多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,已上线 API 平台。该模型纯文本能力与 V4-Flash 正式版持平,视觉理解 Agent Benchmark 表现大幅跃升,接近 Opus-4.8。API 按 token 计费,单张图片最多占 384 tokens,价格与 V4-Flash 一致,支持三种调用格式及三种图片传入方式。

IT之家(RSS)
AI 模型

DeepSeek-V4-Flash-Vision-Exp 多模态模型上线

DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台,文本能力与 V4-Flash 持平,多模态智能体性能大幅跃升,接近 Opus-4.8。DeepSeek Harness 0.1.1 同步发布,开箱即支持新模型,可用 model='deepseek-v4-flash-vision-exp' 调用。

X:Tianyi Cui(@tianyi)
AI 模型

DeepSeek 发布 V4-Flash-Vision-Exp 多模态模型

DeepSeek 推出实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,文本能力与 V4-Flash 持平,涵盖智能体、推理与世界知识。

X:DeepSeek (@deepseek_ai)
AI 模型

神秘新模型Ox Alpha现身:1M上下文免费一周

神秘新AI模型Ox Alpha悄然上线,提供1M上下文窗口、多模态能力、零数据保留,并在一周内近乎无限量免费使用。OpenCode称其每日可处理100万亿token(约每秒11.6亿token),但该模型的开发公司身份尚未公开。

X:Kim (@kimmonismus)
AI 模型

腾讯混元翻译模型上线OpenRouter

我们的翻译模型现已上线 @OpenRouterAI 🌐 • Hy-MT2-1.8B • Hy-MT2-30B-A3B 专为覆盖 33 种语言的真实场景翻译而构建,具备强大的多语言指令跟随能力,适用于结构化、上下文相关及风格引导型任务。 快来试试吧 ↓ https://openrouter.ai/tencent

X:腾讯混元 (@TencentHunyuan)
AI 模型

Ox Alpha 发布:面向编码与智能体任务的免费推理模型

Ox Alpha 是一款面向编码、持续性智能体工作和生产负载的推理模型,现已免费开放使用。该模型支持 1,048,576 token 的上下文窗口,最大输出 131,072 token。

Hacker News 热门(buzzing.cc 中文翻译)
AI 模型

商汤开源 8B 参数多模态大模型 SenseNova U1.5 Lite,原生支持 4K 图像输出

商汤科技今日宣布开源轻量级原生统一多模态大模型 SenseNova U1.5 Lite,该模型拥有 8B 参数,原生支持 3-4k 上下文长度和 4K 高分辨率图像输出。模型支持 Bounding Box、Visual Marker 及多图参考等精细视觉控制,在指令遵循与图像编辑保持度上超越同量级模型,文字渲染与复杂布局能力媲美超大规模商业模型。

IT之家(RSS)
AI 模型

蚂蚁百灵开源 Ling-3.0-tiny / flash Base 模型,开放训练过程关键节点

蚂蚁百灵正式开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base,除最终 Base checkpoint 外,还同步开放预训练和中期训练的权重 checkpoint,共计 6 个。

IT之家(RSS)
AI 模型

Superwhisper 发布 462MB 开源文本规范化模型 S1-mini

Superwhisper 推出 S1 系列,其中 S1-mini 以开源权重发布在 Hugging Face 上。这是一款 0.6B 参数的文本规范化模型,基于 Qwen3-0.6B 微调,用于清理语音识别后的转录文本,去除填充词并应用标点与大小写。

MarkTechPost(RSS)
AI 模型

阿里 Qwen-Image-3.0-Pro 登顶图像编辑榜第六

阿里发布第三代图像模型 Qwen-Image-3.0 系列,旗舰版 Pro 在 Artificial Analysis 图像编辑榜位列第六、文生图榜第九,较上代分别提升 83 和 48 Elo 分。该系列支持 4.5k token 提示词、10 像素级精确文字渲染及 12 种语言,Pro 版定价 $0.04/张(1K 分辨率),已在阿里云 Model Studio 上线。

X:Artificial Analysis (@ArtificialAnlys)
AI 模型

OpenRouter 上线 Ox Alpha 隐身模型

🥷 新隐身模型:Ox Alpha Ox Alpha 是一款前沿模型,专为高效编码、持续智能体工作及实际生产环境使用而构建。 - 1M token 上下文窗口 - 支持文本、图像和视频输入 立即试用并分享反馈以改进模型!https://openrouter.ai/stealth/ox-alpha

X:OpenRouter (@OpenRouter)
AI 模型

Ox Alpha 隐身模型免费开放一周

Ox Alpha(隐身模型)接下来一周免费使用 - 1M 上下文 - 多模态 - 零数据留存 慷慨的速率限制,近乎无限使用 我们每天有 100T token 的处理能力,看看你能做到什么

X:opencode (@opencode)
AI 模型

Liquid AI 发布 LFM2.5-DSpark 草稿模型,解码速度最高提升 3.18 倍且输出不变

Liquid AI 为 LFM2.5 系列三款模型(1.2B-Instruct、2.6B、8B-A1B)发布 DSpark 草稿模型检查点,通过约 300M 参数的草稿模型一次提出 9 个候选 token,由目标模型单次前向验证,在 H100 上解码速度最高提升 3.18 倍,M4 Max MacBook Pro 上最高 2.87 倍。

MarkTechPost(RSS)
AI 模型

DiffusionGemma 技术报告:Google DeepMind 开源离散扩散模型,单卡 H100 每秒生成约 1500 token

Google DeepMind 推出 DiffusionGemma,一个基于 Gemma 4 26B A4B MoE 模型微调而来的实验性开放权重文本扩散模型。

Hacker News 热门(buzzing.cc 中文翻译)
AI 模型

SenseNova U1.5 Lite 开源:8B 原生统一多模态模型

SenseNova 发布 U1.5 Lite,一个 8B 参数的开源轻量级原生统一多模态模型,可同时完成视觉理解、生成与编辑。该模型通过 OPD 将任务专家能力蒸馏进单一模型,推理时无需路由或切换专家,并支持原生 4K 生成、复杂指令遵循及本地编辑。其在指令遵循和编辑保持上超越同尺寸模型,文本渲染与复杂布局上可媲美大型商业模型。

X:Rohan Paul (@rohanpaul_ai)
AI 模型

Meta 发布 Muse Spark 1.2 多模态评测与演示

Meta 发布 Muse Spark 1.2 新评测与演示,展示其多模态能力广度,涵盖视觉转代码、感知转物理动作及音视频理解。演示中,模型解析多模态观察并调用工具,引导机器人在非结构化环境中导航寻找橡皮鸭。

X:AI at Meta (@AIatMeta)
AI 模型

Muse Spark 1.2 多模态模型能力解析

1/ Muse Spark 1.2 是一个非常强大的多模态模型--它能够进行视觉编码、机器人规划以及音视频理解,这些能力通过智能体工具整合在一起。

X:Alexandr Wang(Scale AI 创始人/Meta 首席 AI 官) (@alexandr_wang)
AI 模型

商汤开源 SenseNova U1.5 Lite 轻量多模态模型

商汤发布开源轻量级原生统一多模态模型 SenseNova U1.5 Lite,仅 8B 参数,支持视觉理解、生成与编辑。该模型主打原生 4K 生成、复杂指令跟随、中英文文本渲染及多图参考编辑,在指令跟随和编辑保持上超越同尺寸模型,文本渲染与复杂布局上比肩大型商业模型。

X:商汤 SenseTime (@SenseTime_AI)
AI 模型

Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。

Hugging Face:Blog(RSS)
AI 模型

Harvey 推出首个法律专用后训练模型 Tenet

Harvey 推出首个法律专用后训练模型 Tenet,基于 Kimi K3 底座与 FireworksAI 合作训练。相比底座,Tenet 在 LAB 上全通过率提升 82%、LAB Contracts 提升 22%,后者达 SOTA 并位居 LAB 第二,推理成本低于主流基础模型的四分之一。

X:Elvis Saravia (@omarsar0, DAIR.AI)
AI 模型

微软 Skala 1.1 更新提升计算化学精度

Skala 1.1,微软研究院更新的深度学习交换关联泛函,提供了更高的精度、在计算化学生态系统中更广泛的可及性,以及一个用于跟踪计算性能的活基准。https://msft.it/6016aMXZn

X:Microsoft Research (@MSFTResearch)
AI 模型

Sakana Translateの翻訳モデルを新しい世代の「Sakana Namazu」へアップデート

Sakana AI:Blog(网页)
AI 模型

dots3-note 预览版:长任务自评模型

dots3-note 预览版是一个开放权重模型,专为运行数小时、有时甚至数天的任务而构建。 → 280B 总参数 / 16B 激活参数 → 512K 上下文 → 文本、视觉和语音 → 推理、编码和工具使用 但最有趣的部分不是模型规模。 而是模型如何在长任务完成之前学会评估自身进展。🧵

X:Elvis Saravia (@omarsar0, DAIR.AI)
AI 模型

GEN-1.5:通用型 AI 仅凭单次演示教会机器人新任务

机器人初创公司 Generalist AI 发布 GEN-1.5,该模型可将 3 至 12 秒的演示作为"物理提示词"载入上下文窗口,让机器人无需训练即可执行任务。在开罐、取钱等十项测试中,平均成功率为 59%;用五分钟数据训练十步后,成功率升至 83%。模型还能串联两个提示词、使用仿真演示并部分模仿人类手部动作,但所有结果均出自公司自身,未经独立验证。

The Decoder:AI News(RSS)
AI 模型

Anthropic 内部运行未发布模型"Model 2",性能超越所有公开版 Claude

Anthropic 在内部运行一款未发布的 AI 模型"Model 2",其综合性能略强于 Claude Mythos 5,但在某些领域较弱。据该公司 2026 年 8 月的风险报告,该模型在内部能力指数 AECI 上比 Mythos 5 高约 1.5 点,提升幅度小于从 Mythos Preview 到 Mythos 5 的跃升。该模型主要用于内部编码、数据生成及研究与工程,目前无外部发布计划。

The Decoder:AI News(RSS)
AI 模型

阿里发布 Qwen-UI-Agent,主打让模型真正"会用"每一块屏幕

阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。

IT之家(RSS)
AI 模型

Ornith-1.5 系列开源模型发布:397B 版性能媲美 Claude Opus 4.8,量化版可运行于 iPhone 17

DeepReinforce 推出 Ornith-1.5 系列开源模型,训练中引入"自我改进循环"机制。其中最大 Ornith-1.5-397B 采用 MoE 架构,总参数 3970 亿,性能媲美并在部分测试中超过 Claude Opus 4.8;另有 35B-A3B 与 9B 两个规模,9B 的量化版 Ornith-1.5-9B-Mobile 可在安卓手机及 iPhone 17 上运行。

IT之家(RSS)
AI 模型

Meta Muse Video 生成视频样片曝光,单次 AI 最长生成 10 秒视频

Meta 即将推出 Muse Video 模型,已邀请部分合作伙伴 Beta 测试,单次可生成最长 10 秒视频。测试样片显示其在细节呈现、场景物体关系理解及时间维度稳定性上潜力较高,但 Meta 承认音频与画面同步不足,高速运动物理准确性有差距。现有 10 秒样本尚不足以验证更长叙事、复杂角色一致性或高强度动作场景表现。

IT之家(RSS)