核心导语
今天的 AI 日报是”模型发布日”:xAI 的 Grok 4.6、阿里首次开源 Qwen-Max 级权重 Qwen3.8-2.4T-A95B、微软首个自研推理模型 MAI-Thinking-1、以及 DeepSeek V4 Pro 同日登场——其中 DeepSeek V4 Pro 与 Grok 4.6 更是 2 小时内先后发布。与之相对的,还有一批值得冷静对待的反思类内容——AI 造假(Research Gold)、AI 维护开源项目(AutoGPT)、以及”AI 教科书写作进展停滞”的作者自述。
以下按技术属性分类,精选今日 20 条日报中最具参考价值的条目解读。
一、模型发布/更新
1. xAI 发布 Grok 4.6:强化长时运行智能体能力(1.5T 参数)
xAI 在 Grok 4.5 基础上发布升级版 Grok 4.6(1.5T 参数),核心方向是长时运行智能体与交互式/视觉工作能力的强化。官方给出的定位证据是:在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。
对开发者来说,这释放的信号是”智能体续航”——即模型能否在长时间、多步骤的任务中保持状态一致性、不漂移,正成为前沿模型的比拼点,而非单点准精度。
2. 阿里首次开源 Qwen-Max 级权重:Qwen3.8-2.4T-A95B
这是今天最值得关注的一条。阿里开放了 Qwen3.8-2.4T-A95B 模型权重,关键规格:
- 总参数:2.4T(MoE 架构)
- 每 Token 激活参数:95B
- 上下文:原生支持 262,144 Token(即 256K),并可扩展至 1,010,000 Token(约 1M)
- 定位:Max 级别模型首次开源
- 架构:混合注意力架构(mixed attention architecture)
原生 256K 上下文已是当前主流前沿水平,而扩展至约 1M Token 的能力意味着可以支撑超长文档、完整代码库级上下文这类场景。2.4T 总参 / 95B 激活的 MoE 规模意味着:本地或私有化部署接近顶尖闭源模型能力的系统成为可能。这对实验室、企业私有化场景是重大利好——此前 Qwen 开源的多为 3B-70B 级别的小模型,这次是旗舰级权重直接放出。
来源:https://www.ithome.com/0/989/001.htm
3. LTX-2.5 登场:AI 生成 10 秒 720P 视频仅需 6.8 秒
- 性能:在 2 张 GB200 配置下,AI 生成 10 秒 720P 视频仅需 6.8 秒
- 音频:LTX-2.5 Fast 每秒 0.09 美元即可生成带音频的 720p 视频(视频和音频同时生成)
- 免费策略:年收入低于 1,000 万美元的组织可免费使用
- 生态:原生集成 ComfyUI
低门槛 + ComfyUI 原生集成 + 音视频联合生成,意味着视频生成正从”可玩”走向”可管线化”——开发者可以直接在既有 ComfyUI 工作流里接入这套生成能力,且无需另做音频合成环节。
来源:https://www.ithome.com/0/988/766.htm
4. 微软首发自研推理模型 MAI-Thinking-1
微软在 Microsoft Foundry 平台上线了 MAI-Thinking-1,官方(Mustafa Suleyman)强调这是从零构建、未蒸馏第三方模型的首个微软自研推理模型。这是微软推理能力产品化的正式落地。
来源:https://x.com/mustafasuleyman/status/2087570047967408396
15. DeepSeek V4 Pro 与 Grok 4.6 同日发布,双双逼近 Claude Fable 5 体验
公众号”数字生命卡兹克”报道,DeepSeek V4 Pro 与 Grok 4.6 在 2 小时内先后发布。两款模型的参数规格分别为 DeepSeek V4 Pro 是 1.6T 参数、Grok 4.6 是 1.5T 参数。
两款模型均被评价逼近 Claude Fable 5 体验。结合前文 Qwen 开源、SGLang Day-0 支持等信息,今天的模型发布密度相当高——多个旗舰级、准旗舰级模型在一天内扎堆亮相。
二、产品发布/更新
5. OpenRouter 推出实时网页搜索基准测试
OpenRouter 推出实时网页搜索基准测试(web-search benchmark),用实时排行榜系统评测模型、搜索引擎、搜索方法与预算组合。两个数据点很有参考价值:
- 搜索预算:从 1 轮增至 25 轮,BrowseComp 得分近乎翻倍,而成本仅增加 2.5-7 倍——即”预算翻 25 倍成本只增几倍”,是一笔得分收益远高于成本增长的买卖
- 模型 vs 引擎:模型选择比搜索引擎更重要(平均分差 15 分 vs 10 分)
给 Agent 类应用的初步结论:与其反复调搜索引擎,不如先把模型选对;而把搜索预算从 1 轮拉到 25 轮,虽然成本增加 2.5-7 倍,但得分近乎翻倍,是收益很划算的杠杆。
来源:https://openrouter.ai/blog/announcements/web-search-benchmark
6. Claude in Chrome 侧边栏升级为 Claude Cowork 会话
Chrome 侧边栏里的 Claude 升级为 Claude Cowork 会话,核心变化:
- 对话保存至历史记录(不再是临时会话)
- 技能(Skills)和连接器(Connectors)可在浏览器中工作
- 任务可在桌面、网页、移动端应用之间无缝切换
把浏览器侧栏从”临时问答”变成”可持久化的 Agent 工作空间”,是 Claude 桌面生态往浏览器场景迁移的一步。
来源:https://claude.com/blog/cowork-chrome-side-panel
7. SGLang × Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持
配合 Qwen3.8 开源,SGLang 与 Miles 推理框架发布首日即提供 Day-0 支持。来源对 Qwen 最大开源模型的描述为:2.4T 总参数、每 token 激活 95B、混合注意力架构。
对一个 2.4T 级别的超大规模 MoE 模型,Day-0 推理支持意味着开发者拿到权重当天就能跑起来(而非等社区逆向适配这种超大规模模型)。对自建推理服务团队,这套”2.4T/95B 激活 + 混合注意力”的组合如何做算子优化(例如是否有类似此前”Fused MoE”的优化路径),会是后续关注点。
来源:https://www.lmsys.org/blog/2026-08-12-qwen3-8-day0-support
8. WhatsApp 用端到端加密构建 Scam Alert 诈骗提醒
Meta 用端到端加密 + 设备端 ML构建 WhatsApp 的 Scam Alert 功能:
- 诈骗识别 ML 模型在设备端运行,消息不离开设备、不自动上报
- 模型权重公开发布,供独立验证
- 目前处于 Beta 版有限推出
这是隐私保护与恶意内容检测结合的一个典型案例:既要识别诈骗,又不破坏端到端加密承诺,方案的答案是把推理完全放到设备端。
来源:https://engineering.fb.com/2026/08/12/security/how-were-building-scam-alert-whatsapp
9. Claude Code v2.1.229 发布:远程会话恢复、插件市场命令源及多项修复
- 新增:远程控制会话恢复、自托管 runner 服务器端 hook 支持、插件市场命令源
- 修复:长响应流式输出丢失、窄终端渲染崩溃等问题
对于在远程/自托管环境跑 Claude Code 的团队,“会话恢复”解决了长任务中断后从头再来的痛点;而自托管 runner 的服务器端 hook 支持则让部署方可以在服务端注入校验/钩子逻辑,扩展了自托管场景的定制能力。
来源:https://github.com/anthropics/claude-code/releases/tag/v2.1.229
三、行业动态
10. Research Gold:宣称”100% 人类撰写”,实为全程 AI 驱动
Hacker News 热门的 404 Media 调查发现,医学研究服务 Research Gold 存在系统性造假。该服务对外宣称”100% 人类撰写、绝不使用 AI”,但实际运营却全程由 AI 驱动。调查发现的具体细节:
- 列出的”博士审稿人”系 AI 生成、并不存在
- 部分真实方法学家的身份被冒用/挪用(用真人名字背书,但本人并不知情或未参与)
- AI 助手自称真人应答(用户在不知情的情况下与冒充真人的 AI 助手对话)
这是 AI 时代内容认证问题的典型案例——当 AI 生成质量逼近真人,且被商业主体主动伪装(连背书专家都虚拟化),身份与来源的可验证性成为新的治理难题。对科研出版与评审领域尤甚,因为”人类专家背书”正是其信任体系的核心。
来源:https://www.404media.co/company-offering-100-human-written-never-ai-peer-review-is-entirely-ai
11. RingCentral 用 ChatGPT Work 和 Codex 构建 AI 原生工作流
OpenAI 官网报道,RingCentral 全员发放 ChatGPT Work 和 Codex,其 AI-Native Challenge 让数千名员工(含非技术人员)交付了可运行项目。
对企业组织的一个信号:让”非技术员工”通过 AI 辅助交付可运行项目,“AI 全员化”正从口号变成可执行的规模化实践。
来源:https://openai.com/index/ringcentral
四、论文研究
12. Google:Recall 是参数化事实性的瓶颈,“丢钥匙”而非”空货架”
Google Research 提出的知识画像(knowledge portrait)框架发现:前沿 LLM 的事实编码接近饱和,但”回忆”能力不足——多数事实错误源于”丢钥匙”(无法取出已编码的知识)而非”空货架”(知识根本不存在)。配套推出 WikiProfile 基准:2,150 条事实 × 10 个问题的评测集。
13. Anthropic 联合独立研究者发布工人再培训项目证据综述
Anthropic 联合独立研究者发布关于工人再培训项目的证据综述,其证据来自两方面并列的研究:56 项美国随机研究、以及欧洲实验。综述用于评估面对 AI 劳动力冲击时再培训项目的实际效果。
涉及 AI 对劳动力市场冲击的政策研究者值得直接参考原始综述。
来源:https://www.anthropic.com/research/reviewing-the-evidence-on-worker-retraining-programs
五、技巧与观点
14. 零基础用户半天上手 AI 的 12 步实操流程
“数字生命卡兹克”整理了一套零基础用户的 12 步上手流程,关键要素:
- 硬件前提:16G 内存电脑、订阅 ChatGPT、装 Codex
- 任务交代:用【背景、痛点、需求】框架描述任务
- 需求澄清:用苏格拉底提问法澄清需求
- 沉淀复用:最终把流程沉淀为可复用的 Skill
值得借鉴的是”背景-痛点-需求”的结构化任务描述,和最终把一次性操作沉淀为 Skill 的习惯。
16. AutoGPT:如何用 AGENTS.md 和技能门控(skill gates)管理 AI 生成的 PR
GitHub Blog 介绍了 AutoGPT 项目管理 AI 生成拉取请求的实践,核心手段是技能门控(skill gates)——通过一组强制门槛来筛选/规范智能体提交的代码:
- 强制 PR 模板
- 强制测试计划
- CI 覆盖率门槛
- CLA 签名
效果:把智能体提交的 PR 从”不可用”变成”可用但不符合路线图”。来源还指出,CLA 签名被用作区分人与智能体的”人类探测器”。
对于接受开源贡献、而 AI 生成代码越来越多的维护者,这套门控体系极具参考价值——它不是一刀切拒绝 AI,而是用工程化手段给 AI 贡献划定边界与质量基线。
来源:https://github.blog/open-source/maintainers/your-contributors-are-ai-first-now-is-your-project
17. Nathan Lambert:我写了一本 AI 教科书——AI 还要多久才能写得更好?
Nathan Lambert(Interconnects)反思 LLM 在长文非虚构写作上进展停滞:能改错字、做编辑,但组织整章内容时仍混乱易出错。他进一步认为,这阻碍了机器自主解决开放科学问题。
这是对”AI 已能写长文”的冷静纠偏——单段/短文生成早已过关,但跨度几个章节的结构性组织仍是难点。
来源:https://www.interconnects.ai/p/i-wrote-an-ai-textbook-how-long-until
18. OpenRouter 工具调用指南:一次编写循环,切换模型字符串即可跨模型运行
OpenRouter 的教程展示了如何用同一套工具调用循环,在 Claude、GPT 和开源权重模型间切换——只需改模型字符串即可。教程附 cURL、Python 和 JS/TS 三种语言的示例,覆盖不同技术栈的接入方式。
来源:https://openrouter.ai/blog/tutorials/tool-calling
19. LangChain:什么是 AI 智能体
LangChain 对”智能体 vs 工作流”做了一个清晰的界定:
- 智能体:模型-执行-观察-再行动的自主任循环
- 工作流:固定步骤的预编排
- 互补关系:工作流保证确定性,智能体提供灵活性
来源:https://www.langchain.com/blog/what-is-an-agent
20. OpenAI:企业如何用 ChatGPT 和 Codex 落地智能体 AI
OpenAI 官网称,头部公司已将 AI 从”辅助”转向”执行”,率先把智能体投入实际业务流程。这条与第 11 条 RingCentral 案例互相印证——同一波在企业场景里用 ChatGPT Work + Codex 落地可执行智能体的趋势,正在从单点案例走向行业规模化复制。
来源:https://openai.com/index/how-enterprises-put-ai-to-work
全条目速览(20 条)
| # | 标题 | 来源 |
|---|---|---|
| 1 | xAI 发布 Grok 4.6,强化长时运行智能体能力 | xAI News |
| 2 | 阿里开放 Qwen3.8-2.4T-A95B 权重:2.4T MoE、激活 95B、原生 256K 上下文 | IT之家 |
| 3 | LTX-2.5 登场:AI 生成 10 秒 720P 视频仅需 6.8 秒 | IT之家 |
| 4 | 微软首发自研推理模型 MAI-Thinking-1 | X:Mustafa Suleyman |
| 5 | OpenRouter 推出实时网页搜索基准测试 | OpenRouter |
| 6 | Claude in Chrome 侧边栏升级为 Claude Cowork 会话 | Claude Blog |
| 7 | SGLang 与 Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持 | LMSYS Blog |
| 8 | WhatsApp 用端到端加密构建 Scam Alert 诈骗提醒 | Meta Engineering Blog |
| 9 | Claude Code v2.1.229:远程会话恢复、插件市场命令源及多项修复 | Claude Code GitHub Releases |
| 10 | Research Gold 号称”100% 人类撰写”实为全程 AI 驱动 | Hacker News / 404 Media |
| 11 | RingCentral 用 ChatGPT Work 和 Codex 构建 AI 原生工作流 | OpenAI 官网 |
| 12 | Google:Recall 是参数化事实性的瓶颈,“丢钥匙”而非”空货架” | Google Research |
| 13 | Anthropic 联合发布工人再培训项目证据综述 | Anthropic Research |
| 14 | 零基础用户半天上手 AI 的 12 步实操流程 | 公众号:数字生命卡兹克 |
| 15 | DeepSeek V4 Pro 与 Grok 4.6 同日发布,逼近 Claude Fable 5 体验 | 公众号:数字生命卡兹克 |
| 16 | AutoGPT 用 AGENTS.md 和技能门控管理 AI 生成的 PR | GitHub Blog |
| 17 | 我写了一本 AI 教科书——AI 还要多久才能写得更好? | Nathan Lambert / Interconnects |
| 18 | OpenRouter 工具调用指南:一次编写循环跨模型运行 | OpenRouter |
| 19 | LangChain:什么是 AI 智能体? | LangChain Blog |
| 20 | OpenAI:企业如何用 ChatGPT 和 Codex 落地智能体 AI | OpenAI 官网 |
今日速览
今天的 20 条日报集中在三个方向:
- 模型发布日:Grok 4.6(1.5T)、Qwen3.8-2.4T-A95B(首次开源 Max 权重)、MAI-Thinking-1、DeepSeek V4 Pro(1.6T)+ LTX-2.5,密度极高——其中 Qwen3.8 与 DeepSeek V4 Pro 都在 2.4T/1.6T 级参数上正面冲击旗舰体验。
- 智能体基础设施:OpenRouter 网页搜索基准、SGLang/Qwen Day-0、Claude Cowork 会话、Claude Code 远程会话恢复,都在为 Agent 的长时运行与工程化铺路。
- AI 治理与反思:Research Gold 造假事件、AutoGPT 的 AGENTS.md 门控、Google “Recall 是瓶颈”研究、Nathan Lambert 的长文写作反思,共同指向”当 AI 深度介入内容生产与开源协作后,如何验证来源、设定边界”这一根本问题。
值得持续跟踪的线索:Qwen3.8-2.4T-A95B 的权重释放 + SGLang Day-0 支持,会是接下来推理优化社区的研究热点——尤其是超大规模 MoE 模型在超长上下文场景下的部署与算子优化。
Sources
- xAI 发布 Grok 4.6 — xAI News
- 阿里开放 Qwen3.8-2.4T-A95B 权重(报道) — IT之家
- LTX-2.5 登场:AI 生成 10 秒 720P 视频仅需 6.8 秒(报道) — IT之家
- 微软首发自研推理模型 MAI-Thinking-1 — X(Mustafa Suleyman)
- DeepSeek V4 Pro 与 Grok 4.6 同日发布,逼近 Claude Fable 5 体验 — 公众号:数字生命卡兹克
- OpenRouter 推出实时网页搜索基准测试 — OpenRouter Blog
- Claude in Chrome 侧边栏升级为 Claude Cowork 会话 — Claude Blog
- SGLang × Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持 — LMSYS Blog
- WhatsApp 用端到端加密构建 Scam Alert 诈骗提醒 — Meta Engineering Blog
- Claude Code v2.1.229 Release — GitHub(anthropics/claude-code)
- Research Gold:宣称 100% 人类撰写实为全程 AI 驱动 — 404 Media
- RingCentral 用 ChatGPT Work 和 Codex 构建 AI 原生工作流 — OpenAI
- Recall 是参数化事实性的瓶颈:"丢钥匙"而非"空货架" — Google Research
- 工人再培训项目证据综述 — Anthropic Research
- 零基础用户半天上手 AI 的 12 步实操流程 — 公众号:数字生命卡兹克
- AutoGPT 用 AGENTS.md 和技能门控管理 AI 生成的 PR — GitHub Blog
- 我写了一本 AI 教科书——AI 还要多久才能写得更好? — Interconnects(Nathan Lambert)
- OpenRouter 工具调用指南 — OpenRouter Blog
- 什么是 AI 智能体 — LangChain Blog
- 企业如何用 ChatGPT 和 Codex 落地智能体 AI — OpenAI