AI时代将充满矛盾:人人厌恶又人人使用
这将是一个充满矛盾的时代。 民调会显示,总体上人人都讨厌AI,但同时人人都会偷偷地一直使用AI。AI公司在舆论中会处于水深火热之中,但与此同时,许多人会对自己钟爱的模型产生强烈的情感依恋,并十分在意它。
AI 资讯
大模型、AI 产品、行业动态、论文与实用技巧,内容由 AIHOT 实时聚合;可访问来源支持直达原文。
🧩这将是一个充满矛盾的时代。 民调会显示,总体上人人都讨厌AI,但同时人人都会偷偷地一直使用AI。AI公司在舆论中会处于水深火热之中,但与此同时,许多人会对自己钟爱的模型产生强烈的情感依恋,并十分在意它。
Grok 4.6 在 CursorBench 3.2 上以 70.8% 得分登顶,单任务成本仅 $2.81,比 Fable 5 Max(70.5%,$17.32/任务)便宜约 6 倍,比 Opus 5 Max(70.0%,$8.23/任务)便宜近 3 倍。Elon Musk 推荐通过 Grok Build 或 Cursor 应用使用 Grok 4.6 以获得最佳效果。
现在看来相当确定,Ox Alpha 模型就是 GLM-5.3。Flash 模型大概也是如此,正如 Leo 等人广泛报道的那样。 这给美国前沿实验室带来了巨大压力,与中国之间的差距正在缩小。 下周我们将看到美国实验室如何应对。这将比以往任何时候都更令人兴奋。
两套估算均显示,AI 数据中心当前收入仅数百亿至低千亿美元量级,而资本开支已达数万亿美元,收支严重失衡。与此同时,美国共和党人正加速抛弃数据中心,民调专家 Adam Carlson 收集的四个新案例显示其政治毒性加剧。文章认为,贪婪、愚蠢与傲慢已让 2023 年的行业英雄沦为 2026 年的反派,大科技公司处境或比预期更糟。
马斯克转发Greg Eisenberg观点,称Grok Bot可能是首个让非技术人员通过AI代理团队运营整个业务的工具。Eisenberg分享其朋友Billy用Grok Bot代理运营整个newsletter业务,并预测将出现超10万家类似企业。他给出最佳实践:每套配置聚焦单一任务、先建Chief of Staff代理、用约束保持专注、决策权在人而非代理。
我又有一个 SaaS 要干掉。 (下周分享"干掉我的 SaaS 1"的结果!!)
晶圆代工行业2Q26营收达545亿美元,同比增长28%,连续第十个季度增长,但新增产能仅增6%,增长主要来自涨价和产品组合优化。台积电HPC营收占比达66%创纪录,智能手机降至22%,产能利用率从85%升至90%。3Q26E预计达614亿美元,同比增长34%,为周期内最快增速。
你读过哪些关于开源模型、中美AI对比、知识蒸馏或相关主题的最佳内容?博客、论文、视频、播客均可推荐。
想知道那些执行器里有多少能量储存 还有那恒定的脚步频率 人类虽然努力了,但一旦它启动,就再无机会。
OpenAI 将 GPT-5.6 Sol 的 API 和额度价格下调超 20%,为期三个月,被视为对 Anthropic 的施压信号。此举也得益于其算力基建投资和效率优化,同时面临 DeepSeek 4 Flash 等低价中国模型的竞争压力。推理成本逐年下降,SOTA 模型正被推向更低价格,最终受益的是用户。
开发者与 Claude 合作构建了一个 Claude Code 技能 /debuzz,将 Claude 的回复通过 Gemini CLI 翻译成简洁直白的英文,避免其"千禧年点击诱饵"式表达。该技能支持同事、经理、高管三种模式,分别输出不同详略程度的版本,并承诺逐字打印 Gemini 的翻译结果。
Nvidia 新研究指出,在长时程任务中,模型外的"缰绳"(harness)比底层模型更重要。研究人员通过定制 harness 并加入"监督者"组件,让 Claude Opus 5 在交互推理基准 ARC-AGI-3 上取得 100% 满分,而无 harness 时仅得 30%。该研究还表明,OpenAI 上月通过调整 harness 设置使模型分数提升三倍,但均未达满分。
Anthropic 的人最近经常使用的一个技能:ELI5 /eli5 <你想被解释的内容> "请像对完全不懂这个话题的人解释一样,用带大图和少量文字的 HTML 页面来讲解"
在本周的 In The Cut 节目中,观看 Keyon Harrold 和 Christian Rich 在 Westlake Studios 现场叠加和弦与生成弦乐。
回到 Claude Fable 5:"我让 GPT-5.6 Sol 生成一张最像 Claude 风格的恶搞图,结果它做出了这个。放手一搏吧。"
看看我们的数据团队如何用 Claude Tag 以令人惊叹的方式为 Anthropic 全员提供数据问答支持 https://claude.com/blog/self-service-data-analytics-in-slack-how-anthropic-deploys-claude-tag-for-ad-hoc-questions
墨问西东创始人池建强体验DeepSeek Harness(DSH)一天后,停掉开发两年的客户端并论证全面迁移。DSH是MIT开源的插件化Agent底座,模型无关,支持DeepSeek、OpenAI、Anthropic、Gemini,8月13日发布后GitHub一周约18万星。他判断模型能力已不卡,卡在工程化运行时,DSH相当于开放了Agent的操作系统层。
我给我的 Grok Bot 最好的东西之一…… 就是它自己的邮箱地址。 现在它可以: → 发送邮件 → 接收回复 → 验证账户 → 注册网站 → 在自己的工作流中使用邮件 只需 2 分钟…… 现在它可以在没有我的情况下做更多事了。
AI 正变得如此主动 Energy 看到了我关于需要 Windows 应用签名的 X 帖子,并建议回复微软 VC 的入站邮件,询问联系人。
我喜欢这个
DeepSeek 发布首个多模态大模型 deepseek-v4-flash-vision-exp,具备 v4-flash 能力级别,但不支持音频输入,官网和 API 默认不支持视频输入。作者提供处理视频的教程:直接对视频抽帧,而非转换为 GIF,因为模型虽支持 GIF 输入但只识别第一帧。
大语言模型同等能力水平的成本正急剧下降:2月每任务1.22美元的智能水平如今仅需0.022美元,不到六个月下降56倍,且降速还在加快。按当前速度,特定能力水平的价格每约一年下降100倍。作者以DANDI Archive数据集复用分析为例,说明成本下降让原本只能抽样进行的项目变得可行。
Dex Horthy 预测,到 2026 年底,Bob 将收回"完全不读代码"的立场。尽管 Bob 称 AI 智能体"生产力惊人",但驾驭它们仍需大量专注工作,且离不开软件工程技能,说明确定性 linting 和 AI 代码审查无法让彻底不读代码变得可行。
现实正以赛博朋克式的方式逼近科幻预言:商场出现首家静脉滴注诊所、机器人狗巡逻引发争议、AI歌手走红、机器人主题公园开业、Meta智能眼镜内置人脸识别功能。这些技术进展看似平常却令人不安,而科幻作家们错判的只是数字化的对象--香烟、滑板车和LED取代了霓虹灯。
Databricks 提出将零售需求计划与营销活动、门店执行相连接的方法,以应对零售和消费品团队在复杂运营周期中的决策挑战。文章聚焦于通过统一数据平台整合需求预测、营销活动与门店执行环节,帮助团队在关联但复杂的运营周期中做出更协调的决策。
跟随惊喜的梯度
开源模型正在追赶吗?对比前沿模型各时代的开源与闭源模型,差距在缩小吗?https://newsletter.semianalysis.com/p/are-open-models-catching-up
作者发现自己越来越难以专注阅读同事发来的文档,并意识到这些文档都带有明显的AI生成痕迹,例如照搬Claude的措辞、冗长且充满"内部推理"的技术需求文档。作者认为,尽管研究称人类不擅长识别AI文本,但低质量AI内容其实很容易辨认,其大脑已学会自动忽略这类"空有文字、缺乏意义"的内容。这种对AI内容的"视而不见"反而让作者在工作中效率下降,如同"横幅盲视"一般。
构建和部署AI应用最重要的技能。http://x.com/i/article/2090836273036763142
Grok 4.6 在 Extra High 思考模式下以 70.8% 得分登顶 CursorBench 3.2,单任务成本仅 $2.81。相比 Fable 5 Max(70.5%,$17.32/任务)和 Opus 5 Max(70.0%,$8.23/任务),Grok 得分最高且单任务成本分别低约 6 倍和近 3 倍,凸显其智能体编码效率优势。
François Chollet 称赞 NVIDIA 的 AVO 系统在 ARC-AGI-3 上表现优异,认为其采用深度学习引导的符号世界模型实时合成路径。但他明确指出,在公开演示集上拿 100% 不等于在 ARC-AGI-3 基准上拿 100%,如同通关教程不等于通关游戏。AVO 通过记忆、工具与执行反馈实现长时程任务持续进展。
Dex Horthy 指出,AI SRE 虽当前杠杆极高,但约 18 个月前大量团队未能兑现承诺,导致买家普遍持怀疑态度。他提醒,过早宣传"模型将聪明 2 倍"易损害公司或整个品类的信任,过度超前与落后同样危险,需紧跟实际能力或果断转型。
Thomas Ptacek 主张即便是最小的个人工具也应构建真正的原生用户界面,因为编码智能体已将打造可用 GUI 的成本降至几乎为零。Simon Willison 回应称,他此前用 vibe-coding 开发的 macOS 任务栏带宽与 GPU 监控应用至今仍每日使用,并坦言"快没有借口不这么做了"。
X Square Robot 的 WALL-B 具身智能模型以 1,911 件/小时的速度完成 10,000 件包裹分拣,全程耗时 5 小时 14 分钟。该任务需实时识别包裹朝向、翻转至标签朝上并滑上传送带,软玩具等异形物单独分流。相比 Figure 报告的 2.88 秒/件周期,WALL-B 在更长时长下实现更高吞吐。
腾讯与阿里正以相反路径押注中国AI未来:腾讯季度资本开支达528亿元,同比增长176%,股价次日下跌4.46%;阿里资本开支达677亿元,主要由AI基础设施驱动,两家公司自由现金流均转负。腾讯策略是"模型、智能体、应用"三位一体,将AI融入现有业务(如微信、企业软件);阿里则构建从芯片到应用的完整AI技术栈,更依赖AI热潮持续。
玉伯用同一段故宫亲子游PPT提示词,在YouMind Harness中测试四个不同模型,并公布生成结果供网友竞猜。生图均调用gpt-image-2,其中包含ox和ds-v4-flash-vision-exp模型。猜对驱动模型的用户将获得YouMind会员奖励。
《连线》调查显示,超半数 30 岁以下美国人对 AI"担忧多于兴奋",较五年前增加 24%,超 70% 受访者认为 AI 将导致就业岗位减少。硅谷内部对此分歧公开化:Meta CEO 扎克伯格发文批评悲观论调,Anthropic CEO 阿莫代伊则回应称 AI 面临的根本问题是"信任危机"。报道指出,公众不安已延伸至人际关系、教育及创作者权益等现实领域,重建信任或比提升 AI 能力更重要。
已确认Ox Alpha模型的相关信息。 目前还不能透露任何细节,但我可以确认这是一款非常出色的模型。 我只能说,我们都需要调整自己的时间表。实现前沿多模态智能体能力,正式成为新的竞赛目标。
HumanLayer 中仅用键盘的 diff 审查流程 j、k、v、c 就是你所需要的一切
Matt Webb 在发布 Galactic Compass 2 后,借助 ChatGPT 作为耐心的互动导师,学会了使用四元数来完成应用开发。他认为,即使将大量思考外包给 AI,学习并不会停止,反而会推动他学习更多。这一体验凸显了生成式 AI 在教育场景中的潜力。
NVIDIA 通用编码智能体 AVO 在 ARC-AGI-3 交互推理基准上取得 100% 成绩,完成全部 25 个公开环境中的 183 个关卡。该智能体不依赖规则或目标,通过试错观察学习,并能在上下文重置后长期积累记忆。AVO 由 Claude Opus 5 驱动,此前曾自主运行七天优化 GPU 代码。
这就是为什么手指对人形机器人如此重要,也是一个如此困难的问题。 袋子在手里只停留了大约一秒钟。
NVIDIA 通用编程智能体 AVO 在 ARC-AGI-3 交互推理基准上取得 100% 满分,完成全部 25 个公开环境中的 183 个关卡。AVO 无需指令、显式规则或既定目标即可自主行动,通过持续检查、规划、执行与评估,利用记忆、工具和反馈逐步构建学习能力。
Anthropic 发布 AI 原生 SDLC 实战手册,提出将传统六阶段软件开发生命周期重构为 AI 嵌入各环节的闭环流程。手册指出,当代码不再是瓶颈时,规划、审查、部署等人速环节成为新约束,需通过 Claude 将需求压缩为 intent.md、以技能编码标准、用持续评测替代阶段门禁,并保留人工对关键代码的审查。
DAIR.AI 创始人 Elvis Saravia 回应"无国界创始人"概念,称自己在英国、荷兰、台湾等地跨网络构建,并因此结识 AI 领域顶尖人才。他表示这段经历让他致力于推动 AI 教育与研究普及,坚信 AI 能加速全球创新,让人们在任何地方自由创造。
皮尤研究中心对比2023年至今的网页快照发现,AI写作风格痕迹显著增多:破折号出现频率翻倍,牛津逗号使用增加63%,"delve""interplay"等AI偏好词汇使用量翻番以上。到2026年,9.4%的.com网页呈现明显AI编辑或创作痕迹,而.edu和.gov网页仅约1%。商业网站因流量激励更倾向采用AI工具。
2026年ETF主题榜单与2020年截然不同,AI、核能、太空、国防和基础设施占据主导,取代了此前的清洁能源、新兴市场科技和医疗健康。数据方面,据Citadel数据,ETF净流入正迈向史上最强年份,7月创下历史纪录。与此同时,数据中心建设成为美国多州非住宅建筑支出的重要部分,新墨西哥州和怀俄明州占比约60%,宾夕法尼亚州近30%。
Notion 联合创始人 Akshay Kothari 认为未来工作将由人类与 AI 智能体协作驱动,Notion 正从笔记应用演变为智能体优先的工作空间。其内部人事智能体"Smilers"可基于公司知识回答员工问题,缺失信息时自动创建工单并将答案回写系统,形成自我完善的"公司记忆"。完整访谈见评论区。
西班牙高校实验显示,7 个 Agent 脚手架 × 5 个模型跑同一组 GitHub 任务,不内置 MCP 的轻量脚手架(Pi、Tau)中位 token 消耗 1.4-1.6 万,而 Claude Code 和 qwen-code 需 26-29 万 token,贵 5-28 倍;同一 27B 模型换脚手架成本差 139 倍。