布丁软件

AI 资讯

每日 AI 精选与日报

大模型、AI 产品、行业动态、论文与实用技巧,内容由 AIHOT 实时聚合;可访问来源支持直达原文。

🧩
AI 技能模板40+ 套 AI 技能模板与 Agent 工作流,覆盖办公写作、自媒体创作等场景
技巧

AI时代将充满矛盾:人人厌恶又人人使用

这将是一个充满矛盾的时代。 民调会显示,总体上人人都讨厌AI,但同时人人都会偷偷地一直使用AI。AI公司在舆论中会处于水深火热之中,但与此同时,许多人会对自己钟爱的模型产生强烈的情感依恋,并十分在意它。

X:Ethan Mollick (@emollick)
技巧

Grok 4.6 登顶 CursorBench 3.2 且成本更低

Grok 4.6 在 CursorBench 3.2 上以 70.8% 得分登顶,单任务成本仅 $2.81,比 Fable 5 Max(70.5%,$17.32/任务)便宜约 6 倍,比 Opus 5 Max(70.0%,$8.23/任务)便宜近 3 倍。Elon Musk 推荐通过 Grok Build 或 Cursor 应用使用 Grok 4.6 以获得最佳效果。

X:Elon Musk (@elonmusk, xAI)
技巧

Ox Alpha疑为GLM-5.3,美中差距缩小

现在看来相当确定,Ox Alpha 模型就是 GLM-5.3。Flash 模型大概也是如此,正如 Leo 等人广泛报道的那样。 这给美国前沿实验室带来了巨大压力,与中国之间的差距正在缩小。 下周我们将看到美国实验室如何应对。这将比以往任何时候都更令人兴奋。

X:Kim (@kimmonismus)
技巧

数据中心狂热:AI 行业的经济账与政治反噬

两套估算均显示,AI 数据中心当前收入仅数百亿至低千亿美元量级,而资本开支已达数万亿美元,收支严重失衡。与此同时,美国共和党人正加速抛弃数据中心,民调专家 Adam Carlson 收集的四个新案例显示其政治毒性加剧。文章认为,贪婪、愚蠢与傲慢已让 2023 年的行业英雄沦为 2026 年的反派,大科技公司处境或比预期更糟。

Gary Marcus:The Road to AI We Can Trust(RSS)
技巧

马斯克盛赞Grok Bot:一人团队AI代理运营公司

马斯克转发Greg Eisenberg观点,称Grok Bot可能是首个让非技术人员通过AI代理团队运营整个业务的工具。Eisenberg分享其朋友Billy用Grok Bot代理运营整个newsletter业务,并预测将出现超10万家类似企业。他给出最佳实践:每套配置聚焦单一任务、先建Chief of Staff代理、用约束保持专注、决策权在人而非代理。

X:Elon Musk (@elonmusk, xAI)
技巧

swyx 再宣战:又一款 SaaS 要被我干掉

我又有一个 SaaS 要干掉。 (下周分享"干掉我的 SaaS 1"的结果!!)

X:swyx (@swyx)
技巧

晶圆代工行业Q2营收创纪录545亿美元

晶圆代工行业2Q26营收达545亿美元,同比增长28%,连续第十个季度增长,但新增产能仅增6%,增长主要来自涨价和产品组合优化。台积电HPC营收占比达66%创纪录,智能手机降至22%,产能利用率从85%升至90%。3Q26E预计达614亿美元,同比增长34%,为周期内最快增速。

X:SemiAnalysis (@SemiAnalysis_)
技巧

纳特·兰伯特征集开源模型与中美AI佳作

你读过哪些关于开源模型、中美AI对比、知识蒸馏或相关主题的最佳内容?博客、论文、视频、播客均可推荐。

X:Nathan Lambert (@natolambert)
技巧

人形机器人步频与储能引热议

想知道那些执行器里有多少能量储存 还有那恒定的脚步频率 人类虽然努力了,但一旦它启动,就再无机会。

X:Rohan Paul (@rohanpaul_ai)
技巧

GPT-5.6 降价 20%,OpenAI 施压 Anthropic

OpenAI 将 GPT-5.6 Sol 的 API 和额度价格下调超 20%,为期三个月,被视为对 Anthropic 的施压信号。此举也得益于其算力基建投资和效率优化,同时面临 DeepSeek 4 Flash 等低价中国模型的竞争压力。推理成本逐年下降,SOTA 模型正被推向更低价格,最终受益的是用户。

X:Kim (@kimmonismus)
技巧

克劳黛特:让 Claude 别再像 BuzzFeed 文章那样说话

开发者与 Claude 合作构建了一个 Claude Code 技能 /debuzz,将 Claude 的回复通过 Gemini CLI 翻译成简洁直白的英文,避免其"千禧年点击诱饵"式表达。该技能支持同事、经理、高管三种模式,分别输出不同详略程度的版本,并承诺逐字打印 Gemini 的翻译结果。

Hacker News 热门(buzzing.cc 中文翻译)
技巧

The Healthcare Company That Built the AI Tool It Couldn't Buy

Every:最新文章(网页)
技巧

Nvidia 研究显示:智能体"缰绳"(harness)比 AI 模型本身更关键,Claude Opus 5 在 ARC-AGI-3 上达 100% 满分

Nvidia 新研究指出,在长时程任务中,模型外的"缰绳"(harness)比底层模型更重要。研究人员通过定制 harness 并加入"监督者"组件,让 Claude Opus 5 在交互推理基准 ARC-AGI-3 上取得 100% 满分,而无 harness 时仅得 30%。该研究还表明,OpenAI 上月通过调整 harness 设置使模型分数提升三倍,但均未达满分。

TechCrunch:AI(RSS)
技巧

Anthropic 内部流行 ELI5 技能

Anthropic 的人最近经常使用的一个技能:ELI5 /eli5 <你想被解释的内容> "请像对完全不懂这个话题的人解释一样,用带大图和少量文字的 HTML 页面来讲解"

X:Thariq (@trq212)
技巧

Suno新节目展示现场和弦与生成弦乐

在本周的 In The Cut 节目中,观看 Keyon Harrold 和 Christian Rich 在 Westlake Studios 现场叠加和弦与生成弦乐。

X:Suno (@suno)
技巧

GPT-5.6 Sol 生成 Claude 风格恶搞图

回到 Claude Fable 5:"我让 GPT-5.6 Sol 生成一张最像 Claude 风格的恶搞图,结果它做出了这个。放手一搏吧。"

X:Ethan Mollick (@emollick)
技巧

Anthropic 数据团队用 Claude Tag 赋能数据问答

看看我们的数据团队如何用 Claude Tag 以令人惊叹的方式为 Anthropic 全员提供数据问答支持 https://claude.com/blog/self-service-data-analytics-in-slack-how-anthropic-deploys-claude-tag-for-ad-hoc-questions

X:Noah Zweben(@noahzweben)
技巧

池建强停掉两年客户端,全面迁移DeepSeek Harness

墨问西东创始人池建强体验DeepSeek Harness(DSH)一天后,停掉开发两年的客户端并论证全面迁移。DSH是MIT开源的插件化Agent底座,模型无关,支持DeepSeek、OpenAI、Anthropic、Gemini,8月13日发布后GitHub一周约18万星。他判断模型能力已不卡,卡在工程化运行时,DSH相当于开放了Agent的操作系统层。

X:阿易 AI Notes (@AYi_AInotes)
技巧

Grok Bot 配置专属邮箱后可自主收发邮件

我给我的 Grok Bot 最好的东西之一…… 就是它自己的邮箱地址。 现在它可以: → 发送邮件 → 接收回复 → 验证账户 → 注册网站 → 在自己的工作流中使用邮件 只需 2 分钟…… 现在它可以在没有我的情况下做更多事了。

X:Elon Musk (@elonmusk, xAI)
技巧

AI 主动建议跟进微软 VC 邮件

AI 正变得如此主动 Energy 看到了我关于需要 Windows 应用签名的 X 帖子,并建议回复微软 VC 的入站邮件,询问联系人。

X:Gabriel (@gabriel1)
技巧

查理·霍尔茨点赞一篇推文

我喜欢这个

X:Charlie Holtz(@charlieholtz)
技巧

DeepSeek-V4-Flash-Vision-Exp 视频输入教程

DeepSeek 发布首个多模态大模型 deepseek-v4-flash-vision-exp,具备 v4-flash 能力级别,但不支持音频输入,官网和 API 默认不支持视频输入。作者提供处理视频的教程:直接对视频抽帧,而非转换为 GIF,因为模型虽支持 GIF 输入但只识别第一帧。

X:karminski (@karminski3)
技巧

当智能成本下降100倍时会发生什么

大语言模型同等能力水平的成本正急剧下降:2月每任务1.22美元的智能水平如今仅需0.022美元,不到六个月下降56倍,且降速还在加快。按当前速度,特定能力水平的价格每约一年下降100倍。作者以DANDI Archive数据集复用分析为例,说明成本下降让原本只能抽样进行的项目变得可行。

Hacker News 热门(buzzing.cc 中文翻译)
技巧

预测:Bob 将在 2026 年底前放弃"不看代码"

Dex Horthy 预测,到 2026 年底,Bob 将收回"完全不读代码"的立场。尽管 Bob 称 AI 智能体"生产力惊人",但驾驭它们仍需大量专注工作,且离不开软件工程技能,说明确定性 linting 和 AI 代码审查无法让彻底不读代码变得可行。

X:Dex Horthy(HumanLayer)(@dexhorthy)
技巧

我们正生活在一个宛如J·G·巴拉德或威廉·吉布森笔下的未来世界中

现实正以赛博朋克式的方式逼近科幻预言:商场出现首家静脉滴注诊所、机器人狗巡逻引发争议、AI歌手走红、机器人主题公园开业、Meta智能眼镜内置人脸识别功能。这些技术进展看似平常却令人不安,而科幻作家们错判的只是数字化的对象--香烟、滑板车和LED取代了霓虹灯。

Hacker News 热门(buzzing.cc 中文翻译)
技巧

Databricks 如何打通零售需求计划与营销及门店执行

Databricks 提出将零售需求计划与营销活动、门店执行相连接的方法,以应对零售和消费品团队在复杂运营周期中的决策挑战。文章聚焦于通过统一数据平台整合需求预测、营销活动与门店执行环节,帮助团队在关联但复杂的运营周期中做出更协调的决策。

Databricks:Blog(RSS)
技巧

跟随惊喜的梯度:探索未知

跟随惊喜的梯度

X:Francois Chollet (@fchollet)
技巧

开源模型追赶闭源,差距是否缩小

开源模型正在追赶吗?对比前沿模型各时代的开源与闭源模型,差距在缩小吗?https://newsletter.semianalysis.com/p/are-open-models-catching-up

X:SemiAnalysis (@SemiAnalysis_)
技巧

我正在变得对人工智能视而不见

作者发现自己越来越难以专注阅读同事发来的文档,并意识到这些文档都带有明显的AI生成痕迹,例如照搬Claude的措辞、冗长且充满"内部推理"的技术需求文档。作者认为,尽管研究称人类不擅长识别AI文本,但低质量AI内容其实很容易辨认,其大脑已学会自动忽略这类"空有文字、缺乏意义"的内容。这种对AI内容的"视而不见"反而让作者在工作中效率下降,如同"横幅盲视"一般。

Hacker News 热门(buzzing.cc 中文翻译)
技巧

构建部署AI应用的最重要技能

构建和部署AI应用最重要的技能。http://x.com/i/article/2090836273036763142

X:Andrew Ng(DeepLearning.AI 创始人) (@AndrewYNg)
技巧

Grok 4.6 登顶 CursorBench 且成本最低

Grok 4.6 在 Extra High 思考模式下以 70.8% 得分登顶 CursorBench 3.2,单任务成本仅 $2.81。相比 Fable 5 Max(70.5%,$17.32/任务)和 Opus 5 Max(70.0%,$8.23/任务),Grok 得分最高且单任务成本分别低约 6 倍和近 3 倍,凸显其智能体编码效率优势。

X:Elon Musk (@elonmusk, xAI)
技巧

François Chollet 评 NVIDIA AVO:ARC-AGI-3 满分不等于基准满分

François Chollet 称赞 NVIDIA 的 AVO 系统在 ARC-AGI-3 上表现优异,认为其采用深度学习引导的符号世界模型实时合成路径。但他明确指出,在公开演示集上拿 100% 不等于在 ARC-AGI-3 基准上拿 100%,如同通关教程不等于通关游戏。AVO 通过记忆、工具与执行反馈实现长时程任务持续进展。

X:Francois Chollet (@fchollet)
技巧

AI SRE 赛道因过早炒作遭买家质疑

Dex Horthy 指出,AI SRE 虽当前杠杆极高,但约 18 个月前大量团队未能兑现承诺,导致买家普遍持怀疑态度。他提醒,过早宣传"模型将聪明 2 倍"易损害公司或整个品类的信任,过度超前与落后同样危险,需紧跟实际能力或果断转型。

X:Dex Horthy(HumanLayer)(@dexhorthy)
技巧

别再写 TUI 了:Thomas Ptacek 呼吁用原生 UI 替代命令行工具

Thomas Ptacek 主张即便是最小的个人工具也应构建真正的原生用户界面,因为编码智能体已将打造可用 GUI 的成本降至几乎为零。Simon Willison 回应称,他此前用 vibe-coding 开发的 macOS 任务栏带宽与 GPU 监控应用至今仍每日使用,并坦言"快没有借口不这么做了"。

Simon Willison 博客
技巧

X Square Robot 的 WALL-B 具身智能模型完成 10,000 件包裹分拣

X Square Robot 的 WALL-B 具身智能模型以 1,911 件/小时的速度完成 10,000 件包裹分拣,全程耗时 5 小时 14 分钟。该任务需实时识别包裹朝向、翻转至标签朝上并滑上传送带,软玩具等异形物单独分流。相比 Figure 报告的 2.88 秒/件周期,WALL-B 在更长时长下实现更高吞吐。

X:Rohan Paul (@rohanpaul_ai)
技巧

腾讯与阿里:押注中国AI未来的两条路径

腾讯与阿里正以相反路径押注中国AI未来:腾讯季度资本开支达528亿元,同比增长176%,股价次日下跌4.46%;阿里资本开支达677亿元,主要由AI基础设施驱动,两家公司自由现金流均转负。腾讯策略是"模型、智能体、应用"三位一体,将AI融入现有业务(如微信、企业软件);阿里则构建从芯片到应用的完整AI技术栈,更依赖AI热潮持续。

X:X.PIN (@thexpin)
技巧

四模型同题竞答,猜驱动赢会员

玉伯用同一段故宫亲子游PPT提示词,在YouMind Harness中测试四个不同模型,并公布生成结果供网友竞猜。生图均调用gpt-image-2,其中包含ox和ds-v4-flash-vision-exp模型。猜对驱动模型的用户将获得YouMind会员奖励。

X:Frank Wang 玉伯 (@lifesinger)
技巧

美国年轻人对 AI 抵触情绪上升,硅谷高管就公众信任爆发公开分歧

《连线》调查显示,超半数 30 岁以下美国人对 AI"担忧多于兴奋",较五年前增加 24%,超 70% 受访者认为 AI 将导致就业岗位减少。硅谷内部对此分歧公开化:Meta CEO 扎克伯格发文批评悲观论调,Anthropic CEO 阿莫代伊则回应称 AI 面临的根本问题是"信任危机"。报道指出,公众不安已延伸至人际关系、教育及创作者权益等现实领域,重建信任或比提升 AI 能力更重要。

IT之家(RSS)
技巧

Ox Alpha模型确认,前沿多模态智能体竞赛开启

已确认Ox Alpha模型的相关信息。 目前还不能透露任何细节,但我可以确认这是一款非常出色的模型。 我只能说,我们都需要调整自己的时间表。实现前沿多模态智能体能力,正式成为新的竞赛目标。

X:Elvis Saravia (@omarsar0, DAIR.AI)
技巧

HumanLayer 纯键盘 diff 审查流程

HumanLayer 中仅用键盘的 diff 审查流程 j、k、v、c 就是你所需要的一切

X:Dex Horthy(HumanLayer)(@dexhorthy)
技巧

Matt Webb:用 ChatGPT 当互动导师,我学会了四元数

Matt Webb 在发布 Galactic Compass 2 后,借助 ChatGPT 作为耐心的互动导师,学会了使用四元数来完成应用开发。他认为,即使将大量思考外包给 AI,学习并不会停止,反而会推动他学习更多。这一体验凸显了生成式 AI 在教育场景中的潜力。

Simon Willison 博客
技巧

NVIDIA AVO 编码智能体 ARC-AGI-3 满分通关

NVIDIA 通用编码智能体 AVO 在 ARC-AGI-3 交互推理基准上取得 100% 成绩,完成全部 25 个公开环境中的 183 个关卡。该智能体不依赖规则或目标,通过试错观察学习,并能在上下文重置后长期积累记忆。AVO 由 Claude Opus 5 驱动,此前曾自主运行七天优化 GPU 代码。

X:Kim (@kimmonismus)
技巧

人形机器人手指为何如此关键

这就是为什么手指对人形机器人如此重要,也是一个如此困难的问题。 袋子在手里只停留了大约一秒钟。

X:Rohan Paul (@rohanpaul_ai)
技巧

NVIDIA AVO 满分通过 ARC-AGI-3 基准

NVIDIA 通用编程智能体 AVO 在 ARC-AGI-3 交互推理基准上取得 100% 满分,完成全部 25 个公开环境中的 183 个关卡。AVO 无需指令、显式规则或既定目标即可自主行动,通过持续检查、规划、执行与评估,利用记忆、工具和反馈逐步构建学习能力。

X:Testing Catalog (@testingcatalog)
技巧

AI 原生 SDLC 实战手册:Anthropic 如何用 Claude 重塑软件开发生命周期

Anthropic 发布 AI 原生 SDLC 实战手册,提出将传统六阶段软件开发生命周期重构为 AI 嵌入各环节的闭环流程。手册指出,当代码不再是瓶颈时,规划、审查、部署等人速环节成为新约束,需通过 Claude 将需求压缩为 intent.md、以技能编码标准、用持续评测替代阶段门禁,并保留人工对关键代码的审查。

Claude:Blog(网页)
技巧

无国界创始人:AI 教育普及与创新加速

DAIR.AI 创始人 Elvis Saravia 回应"无国界创始人"概念,称自己在英国、荷兰、台湾等地跨网络构建,并因此结识 AI 领域顶尖人才。他表示这段经历让他致力于推动 AI 教育与研究普及,坚信 AI 能加速全球创新,让人们在任何地方自由创造。

X:Elvis Saravia (@omarsar0, DAIR.AI)
技巧

皮尤:AI写作痕迹正重塑网页风格

皮尤研究中心对比2023年至今的网页快照发现,AI写作风格痕迹显著增多:破折号出现频率翻倍,牛津逗号使用增加63%,"delve""interplay"等AI偏好词汇使用量翻番以上。到2026年,9.4%的.com网页呈现明显AI编辑或创作痕迹,而.edu和.gov网页仅约1%。商业网站因流量激励更倾向采用AI工具。

X:Rohan Paul (@rohanpaul_ai)
技巧

主题轮动之风:ETF 主题从清洁能源转向 AI、核能与太空

2026年ETF主题榜单与2020年截然不同,AI、核能、太空、国防和基础设施占据主导,取代了此前的清洁能源、新兴市场科技和医疗健康。数据方面,据Citadel数据,ETF净流入正迈向史上最强年份,7月创下历史纪录。与此同时,数据中心建设成为美国多州非住宅建筑支出的重要部分,新墨西哥州和怀俄明州占比约60%,宾夕法尼亚州近30%。

a16z:News(RSS)
技巧

Notion 联合创始人谈智能体优先工作空间

Notion 联合创始人 Akshay Kothari 认为未来工作将由人类与 AI 智能体协作驱动,Notion 正从笔记应用演变为智能体优先的工作空间。其内部人事智能体"Smilers"可基于公司知识回答员工问题,缺失信息时自动创建工单并将答案回写系统,形成自我完善的"公司记忆"。完整访谈见评论区。

X:Kim (@kimmonismus)
技巧

西班牙高校论文:Agent 脚手架比模型更影响成本

西班牙高校实验显示,7 个 Agent 脚手架 × 5 个模型跑同一组 GitHub 任务,不内置 MCP 的轻量脚手架(Pi、Tau)中位 token 消耗 1.4-1.6 万,而 Claude Code 和 qwen-code 需 26-29 万 token,贵 5-28 倍;同一 27B 模型换脚手架成本差 139 倍。

X:阿易 AI Notes (@AYi_AInotes)