GLM 5.3 Flash 疑现身,加速竞赛开启
据 @synthwavedd 爆料,OpenRouter 上的神秘模型 "Ox Alpha" 疑为即将推出的 GLM 5.3 Flash。若属实,这款 Flash 模型性能将超越 Fable 和 GPT Sol 等顶级模型,zAI 的后训练能力令西方模型相形见绌。Kimi k3.1 或也将发布,行业加速竞赛一触即发。
AI 资讯
大模型、AI 产品、行业动态、论文与实用技巧,内容由 AIHOT 实时聚合;可访问来源支持直达原文。
🧩DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp,在图像理解基础上保持文本推理能力,其内部智能体基准测试成绩接近 Opus 4.8。该模型兼容 OpenAI 与 Anthropic API,支持 Base64、URL(32 MiB)及免费 Files API(64 MiB)三种传图方式,单图成本最高 384 tokens,单次请求最多 600 张图片。
据 @synthwavedd 爆料,OpenRouter 上的神秘模型 "Ox Alpha" 疑为即将推出的 GLM 5.3 Flash。若属实,这款 Flash 模型性能将超越 Fable 和 GPT Sol 等顶级模型,zAI 的后训练能力令西方模型相形见绌。Kimi k3.1 或也将发布,行业加速竞赛一触即发。
TARS 推出具身原生基础模型 AWE 3.5,采用"Born as One"架构,将动作、感知、几何与触觉整合进单一模型,而非后期拼接。该模型支持数分钟长时程闭环推理,任务执行效率约为 PI0.5 的 2 倍,并通过预训练双先验与后训练世界引擎滚动预测来优化决策。
今天我们开源了 Ling-3.0-flash-dspark,这是一个专为 Ling-3.0-flash 构建的 DSpark 草稿模型。在 4 块 NVIDIA Blackwell GPU 上,batch 为 1 时,它在 1,000 个请求中实现了 1,120 tok/s 的吞吐量、0.78 ms 的平均 TPOT,以及 9.95 的接受长度。🧵
据 @synthwavedd,OpenRouter 上的神秘模型"Ox Alpha"实为智谱即将推出的 GLM 5.3 Flash。若属实,该 Flash 模型性能或超越 Fable、GPT Sol 等顶级模型,zAI 的后训练能力将令西方模型相形见绌。此外,Kimi K3.1 也疑似以"korrine"代号在 Code Arena 测试。
推出 Runway Ruby。 一款新模型,可将 SDR 视频转换为 ProRes 和 EXR 序列中的 16 位 HDR。兼容任何已上传的视频或生成的输出,最长 30 秒。
DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台,文本能力与 V4-Flash 持平,多模态智能体基准测试大幅跃升,性能接近 Opus-4.8。Ox Alpha 支持 1M token 上下文,可处理文本、图像和视频输入,在编码与智能体任务中表现出色。DeepSeek Harness 0.1.1 同步发布,开箱支持新模型。
这么好的模型,竟然没人猜它是谷歌的 【引用 @opencode】:Ox Alpha(隐身模型)接下来一周免费使用 - 1M 上下文窗口 - 多模态 - 零数据留存 慷慨的速率限制,近乎无限使用 我们每天可处理 100T token 的容量,看看你能用它做什么
面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。
DeepSeek V4 Flash Vision Exp 已在 OpenRouter 上线! @deepseek_ai 的新模型支持图像输入,定价与 V4 Flash 相同,在文本智能体基准测试中与 V4 Flash 0731 持平,并在 Agents' Last Exam 和 ZeroBench 上超越 Opus-4.8。 立即使用:https://openrouter.ai/deepseek/deepseek-v4-flash-vision-exp
DeepSeek 推出 DeepSeek-v4-flash-vision-exp 模型,可同时接受图像与文本输入。用户能要求模型描述图片、从截图中读取文字、分析图表等。该实验版本扩展了 DeepSeek 的多模态能力。
DeepSeek 发布实验性多模态模型 V4-Flash-Vision-Exp,文本能力对标 V4-Flash,多模态智能体基准大幅跃升,性能接近 Opus-4.8。模型已上线 API 平台,可用 model='deepseek-v4-flash-vision-exp' 调用,同日发布 DeepSeek Harness 0.1.1 支持新模型。网友 @梁子 借新模型上线之际,呼吁官方降价。
DeepSeek 发布实验性多模态模型 deepseek-v4-flash-vision-exp,文本能力对齐 V4-Flash,多模态 Agent 性能逼近 Opus-4.8,Agents Last Exam 27.3 对 25.7、ZeroBench 35.0 对 34.0。
DeepSeek 推出实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,面向需要视觉能力的智能体,已在 DeepSeek API 平台上线。
DeepSeek 在 API 平台上线多模态模型 deepseek-v4-flash-vision-exp,文本性能接近 Opus 4.8 并持平 DeepSeek-V4-Flash。
DeepSeek 上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,可通过设置 model='deepseek-v4-flash-vision-exp' 在 API 平台访问。
深度求索发布多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,已上线 API 平台。该模型纯文本能力与 V4-Flash 正式版持平,视觉理解 Agent Benchmark 表现大幅跃升,接近 Opus-4.8。API 按 token 计费,单张图片最多占 384 tokens,价格与 V4-Flash 一致,支持三种调用格式及三种图片传入方式。
DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台,文本能力与 V4-Flash 持平,多模态智能体性能大幅跃升,接近 Opus-4.8。DeepSeek Harness 0.1.1 同步发布,开箱即支持新模型,可用 model='deepseek-v4-flash-vision-exp' 调用。
DeepSeek 推出实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,文本能力与 V4-Flash 持平,涵盖智能体、推理与世界知识。
神秘新AI模型Ox Alpha悄然上线,提供1M上下文窗口、多模态能力、零数据保留,并在一周内近乎无限量免费使用。OpenCode称其每日可处理100万亿token(约每秒11.6亿token),但该模型的开发公司身份尚未公开。
我们的翻译模型现已上线 @OpenRouterAI 🌐 • Hy-MT2-1.8B • Hy-MT2-30B-A3B 专为覆盖 33 种语言的真实场景翻译而构建,具备强大的多语言指令跟随能力,适用于结构化、上下文相关及风格引导型任务。 快来试试吧 ↓ https://openrouter.ai/tencent
Ox Alpha 是一款面向编码、持续性智能体工作和生产负载的推理模型,现已免费开放使用。该模型支持 1,048,576 token 的上下文窗口,最大输出 131,072 token。
商汤科技今日宣布开源轻量级原生统一多模态大模型 SenseNova U1.5 Lite,该模型拥有 8B 参数,原生支持 3-4k 上下文长度和 4K 高分辨率图像输出。模型支持 Bounding Box、Visual Marker 及多图参考等精细视觉控制,在指令遵循与图像编辑保持度上超越同量级模型,文字渲染与复杂布局能力媲美超大规模商业模型。
蚂蚁百灵正式开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base,除最终 Base checkpoint 外,还同步开放预训练和中期训练的权重 checkpoint,共计 6 个。
Superwhisper 推出 S1 系列,其中 S1-mini 以开源权重发布在 Hugging Face 上。这是一款 0.6B 参数的文本规范化模型,基于 Qwen3-0.6B 微调,用于清理语音识别后的转录文本,去除填充词并应用标点与大小写。
阿里发布第三代图像模型 Qwen-Image-3.0 系列,旗舰版 Pro 在 Artificial Analysis 图像编辑榜位列第六、文生图榜第九,较上代分别提升 83 和 48 Elo 分。该系列支持 4.5k token 提示词、10 像素级精确文字渲染及 12 种语言,Pro 版定价 $0.04/张(1K 分辨率),已在阿里云 Model Studio 上线。
🥷 新隐身模型:Ox Alpha Ox Alpha 是一款前沿模型,专为高效编码、持续智能体工作及实际生产环境使用而构建。 - 1M token 上下文窗口 - 支持文本、图像和视频输入 立即试用并分享反馈以改进模型!https://openrouter.ai/stealth/ox-alpha
Ox Alpha(隐身模型)接下来一周免费使用 - 1M 上下文 - 多模态 - 零数据留存 慷慨的速率限制,近乎无限使用 我们每天有 100T token 的处理能力,看看你能做到什么
Liquid AI 为 LFM2.5 系列三款模型(1.2B-Instruct、2.6B、8B-A1B)发布 DSpark 草稿模型检查点,通过约 300M 参数的草稿模型一次提出 9 个候选 token,由目标模型单次前向验证,在 H100 上解码速度最高提升 3.18 倍,M4 Max MacBook Pro 上最高 2.87 倍。
Google DeepMind 推出 DiffusionGemma,一个基于 Gemma 4 26B A4B MoE 模型微调而来的实验性开放权重文本扩散模型。
SenseNova 发布 U1.5 Lite,一个 8B 参数的开源轻量级原生统一多模态模型,可同时完成视觉理解、生成与编辑。该模型通过 OPD 将任务专家能力蒸馏进单一模型,推理时无需路由或切换专家,并支持原生 4K 生成、复杂指令遵循及本地编辑。其在指令遵循和编辑保持上超越同尺寸模型,文本渲染与复杂布局上可媲美大型商业模型。
Meta 发布 Muse Spark 1.2 新评测与演示,展示其多模态能力广度,涵盖视觉转代码、感知转物理动作及音视频理解。演示中,模型解析多模态观察并调用工具,引导机器人在非结构化环境中导航寻找橡皮鸭。
1/ Muse Spark 1.2 是一个非常强大的多模态模型--它能够进行视觉编码、机器人规划以及音视频理解,这些能力通过智能体工具整合在一起。
商汤发布开源轻量级原生统一多模态模型 SenseNova U1.5 Lite,仅 8B 参数,支持视觉理解、生成与编辑。该模型主打原生 4K 生成、复杂指令跟随、中英文文本渲染及多图参考编辑,在指令跟随和编辑保持上超越同尺寸模型,文本渲染与复杂布局上比肩大型商业模型。
Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。
Harvey 推出首个法律专用后训练模型 Tenet,基于 Kimi K3 底座与 FireworksAI 合作训练。相比底座,Tenet 在 LAB 上全通过率提升 82%、LAB Contracts 提升 22%,后者达 SOTA 并位居 LAB 第二,推理成本低于主流基础模型的四分之一。
Skala 1.1,微软研究院更新的深度学习交换关联泛函,提供了更高的精度、在计算化学生态系统中更广泛的可及性,以及一个用于跟踪计算性能的活基准。https://msft.it/6016aMXZn
dots3-note 预览版是一个开放权重模型,专为运行数小时、有时甚至数天的任务而构建。 → 280B 总参数 / 16B 激活参数 → 512K 上下文 → 文本、视觉和语音 → 推理、编码和工具使用 但最有趣的部分不是模型规模。 而是模型如何在长任务完成之前学会评估自身进展。🧵
机器人初创公司 Generalist AI 发布 GEN-1.5,该模型可将 3 至 12 秒的演示作为"物理提示词"载入上下文窗口,让机器人无需训练即可执行任务。在开罐、取钱等十项测试中,平均成功率为 59%;用五分钟数据训练十步后,成功率升至 83%。模型还能串联两个提示词、使用仿真演示并部分模仿人类手部动作,但所有结果均出自公司自身,未经独立验证。
Anthropic 在内部运行一款未发布的 AI 模型"Model 2",其综合性能略强于 Claude Mythos 5,但在某些领域较弱。据该公司 2026 年 8 月的风险报告,该模型在内部能力指数 AECI 上比 Mythos 5 高约 1.5 点,提升幅度小于从 Mythos Preview 到 Mythos 5 的跃升。该模型主要用于内部编码、数据生成及研究与工程,目前无外部发布计划。
阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。
DeepReinforce 推出 Ornith-1.5 系列开源模型,训练中引入"自我改进循环"机制。其中最大 Ornith-1.5-397B 采用 MoE 架构,总参数 3970 亿,性能媲美并在部分测试中超过 Claude Opus 4.8;另有 35B-A3B 与 9B 两个规模,9B 的量化版 Ornith-1.5-9B-Mobile 可在安卓手机及 iPhone 17 上运行。
Meta 即将推出 Muse Video 模型,已邀请部分合作伙伴 Beta 测试,单次可生成最长 10 秒视频。测试样片显示其在细节呈现、场景物体关系理解及时间维度稳定性上潜力较高,但 Meta 承认音频与画面同步不足,高速运动物理准确性有差距。现有 10 秒样本尚不足以验证更长叙事、复杂角色一致性或高强度动作场景表现。
独家 🔥:抢先看 Meta AI 的 Muse 视频模型首批输出。 > Muse 视频目前正处于封闭测试阶段。 > 该模型对受版权保护的内容已相当严格限制。 > 原生音频支持语音和音乐,开箱即用。 如果该模型最终免费开放到 Meta 各产品中,将是一记重拳。 有什么提示词值得我试试吗?👀
猜猜是哪个模型?(未发布,当然)👀 测试提示词:"赛博朋克黑客机器人在多台显示器前工作"
推出 GEN-1.5,一个一次性学习者。 它能在几秒内学会新任务。向它展示要做什么,它便能泛化。 这一能力源于在大规模物理数据上的预训练,是迈向为物理世界构建通用智能这一使命的一步。
本地托管 🤝🇨🇦 本地制造
Muse Spark 1.2 Contributor 现已在 OpenCode Go 上可用 该模型将基于你的数据进行训练,因此需要明确选择加入,并在某些地区受到限制 作为交换,你将获得极高的使用额度
Ornith-1.5 发布,将 Ornith-1.0 的自我构建框架扩展为完整自我优化闭环:模型自主提出任务、生成任务专属脚手架并产出解决方案用于强化学习。