← report AI日报 · 2026-08-12

AI 日报精选 2026-08-11:Nemotron 3.5 Lightning、Mojo 1.0、加密推理漏洞

解读 2026-08-11 AI 日报:NVIDIA Nemotron 3.5 Lightning 开源智能体模型、Mojo 1.0 正式版、LLM 加密推理过程可被读取的 API 漏洞、ChatGPT 与 Gemini 双双破 10 亿月活等 20 条动态中的技术要点。

12 min read AI HOT 日报 2026-08-11 精选解读:模型发布与推理优化、开源产品、安全漏洞与行业动态,共 20 条中的 14 条技术要点。

今日(2026-08-11)的 AI 日报信息量巨大,横跨模型发布、开源产品、安全漏洞与基础设施优化。其中英伟达连发两弹(Nemotron 3.5 Lightning + Nemotron 4 传闻)、Mojo 语言 1.0 正式发布、以及可读取大模型”加密思考过程”的 API 漏洞,是最值得开发者与架构师关注的几条主线。以下按技术属性分类,精选最具深度与参考价值的条目解读。

一、模型发布与推理优化

1. NVIDIA Nemotron 3.5 Lightning:面向常驻智能体的开源 MoE

NVIDIA 开源了 Nemotron 3.5 Lightning,一个 30B 总参数的 MoE 模型,明确定位为”面向常驻智能体(resident agent)“设计。官方公布的数据:token 生成速度最高提升 4 倍,任务完成时间缩短 30%,可在 RTX PC、DGX Spark、Jetson 上运行(来源:https://blogs.nvidia.com/blog/local-ai-open-source-models-agents-nemotron)。

与此同时,SGLang 宣布 Day-0 支持(https://www.lmsys.org/blog/2026-08-11-nemotron-3-5-lightning),关键规格是 30B 总参数 / 3B 激活参数,支持最长 1M token 上下文,可走 OpenAI 兼容 API 直接接入智能体工作流。

把两条信息合起来看,“常驻智能体 + 本地可运行”是当前开源智能体的关键设计取舍:激活参数仅 3B,意味着本地算力就能扛日常 agent 调用的 token 吞吐,而 1M 长上下文则为长时间运行的多轮任务保留足够的记忆窗口。对想自建本地智能体服务的团队,这套规格值得做一次基准测试对标。

注:同一波特讯息中还传出英伟达正在开发万亿参数的 Nemotron 4(目标至少 1 万亿参数,最早今年秋末就绪,IT之家报道 https://www.ithome.com/0/988/524.htm)。这与本周开源 3.5 Lightning 是两条并行线——前者面向端侧落地,后者对标闭源旗舰开源模型。传闻尚未证实,仅作方向参考。

2. LTX-2.5:720P 视频生成提速到秒级

IT之家报道(https://www.ithome.com/0/988/766.htm),LTX-2.5 在 2 张 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒,并原生集成 ComfyUI。授权方面,年收入低于 1000 万美元的组织可免费使用。

视频生成从”分钟级”跨入”秒级”对工作流的意义很大:当单次生成足够快,做”先生成再筛选”的迭代式创作就变得可行,而不再依赖逐帧精修。ComfyUI 原生集成则意味着没有复杂的工程接入成本。

3. 统一 Radix 缓存:为混合模型前缀缓存构建单一树

LMSYS 发布了一篇工程向的研究(https://www.lmsys.org/blog/2026-08-11-unified-radix-cache):用**单一 token 键控的 radix 拓扑**统一管理混合模型的 FULL、SWA 与 MAMBA 组件缓存。

此前混合架构(如同时含全注意力、滑窗注意力与状态空间模组)的前缀缓存各自为政,命中率低。统一到一棵 token 键控的 radix 树后,不同层级的组件可以共享同一前缀,从而提升长上下文场景下的缓存命中与复用效率。对自建推理栈的团队,这是 SGLang/类 radix 缓存系统在混合模型上的一次有参考价值的演进。

4. Apple Silicon 虚拟机借助 Llama.cpp 实现 11–16 倍推理加速

Hacker News 热门的一项工作(https://github.com/trycua/cua/blob/main/blog/gpu-passthrough-macos-vms.md)演示了 Apple Silicon 虚拟机通过 GPU passthrough + Llama.cpp 获得显著加速:在 M1 Ultra 上,TinyLlama 1.1B 的提示处理提速 11.08 倍、token 生成提速 16.36 倍,接近裸机性能的 98%。

这条的价值在于:以往 Apple Silicon 上的 LLM 本地推理是”物理机直跑”的专享,虚拟机要么拿不到 GPU,要么性能损耗严重。此次把 GPU passthrough 打通并逼近裸机,意味着开发者可以在统一的虚拟机基座里跑本地模型,同时保留虚拟化带来的环境隔离与快照回滚能力——对本地开发、测试环境的多模型并存管理很有用。

二、开源与产品发布

5. Meta 首个开放权重模型 Muse Glimmer 登陆 OpenRouter

OpenRouter(https://x.com/OpenRouter/status/2087509478480765218)宣布 Meta 超级智能实验室(Superintelligence Labs)的首个开放权重模型 Muse Glimmer 上线。规格:30B 密集文本+图像,Apache 2.0 许可,MCP Atlas 得分 75.5,定位”可靠本地智能体”。

“首个开放权重模型”意味着 Meta 的超级智能 Lab 正式切入开源权重赛道,且直接对标智能体能力(MCP Atlas 评测的是模型在真实 MCP 工具调用场景下的表现)。Apache 2.0(而非 Meta 惯用的 Llama 社区许可)也是一个信号——许可放宽有利于更自由的商用与再分发。

6. Mojo 1.0 正式发布

Modular 宣布通用语言 Mojo 发布首个稳定生产版本(https://www.modular.com/blog/modular-26-5-mojo-1-0-is-here):近 200 名贡献者合入超 1100 个 PR。

Mojo 一直主打”Python 的易用性 + 系统级性能”,目标是补齐 Python 在 JIT/编译性能上的短板。1.0 稳定版意味着 API 与语言特性进入冻结期,不再向后破坏性变更,适合开始在关键路径上评估采用。对做 AI 推理、科学计算且受 Python 性能瓶颈困扰的团队,值得在 1.0 上做一次 pilot。

7. Gemini 助力 Database Migration Service 加速 PostgreSQL 迁移

Google Cloud 发布配合(https://cloud.google.com/blog/products/databases/accelerate-postgresql-migrations-with-gemini-in-dms)——利用 Gemini 做 AI 辅助代码转换,可将 Oracle / SQL Server 的存储过程、触发器、自定义函数转换为 PL/pgSQL。

数据库迁移最耗时的是应用侧 SQL/存储过程改写,手动转 PL/pgSQL 极易出错。AI 辅助转换把这段工作自动化后,迁移周期可以显著缩短,但产出仍需要 DBA 复核——这类转换工具的价值在于”降低人工改写量”,而非”完全无人值守”。

8. ChatGPT 桌面端支持导入其他智能体工作数据

OpenAI Developers(https://x.com/OpenAIDevs/status/2087242829076791392)宣布 ChatGPT 桌面端可将其他智能体的项目、聊天记录、技能和插件导入,并与 ChatGPT Work / Codex 同步,支持自动更新。

这本质上是厂商在做”智能体生态迁移”的顺滑化——降低用户从其他 agent 平台迁往 OpenAI 生态的摩擦。对已经在用 Copilot/其他 agent 积累了大量工作流的团队,迁移成本是在做递减。它对开发者的信号是:AI 编程工具的数据可携带性正在成为竞争要素。

三、安全与行业动态

9. LLM “加密推理过程”可被读取的 API 漏洞

The Decoder 报道(https://the-decoder.com/but-marinade-and-leaked-passwords-are-what-researchers-found-in-chatgpts-hidden-reasoning),研究人员发现可读取 ChatGPT 等模型加密推理过程的 API 漏洞。重点数据:

  • 扫描约 7000 条公开会话,发现 62 个 API 密钥、33 个邮箱、33 个密码;
  • 通过越狱,Haiku 4.5 可逐字转写 Opus 4.8 的原始推理。

这条要分两层看。技术层:如果模型输出的隐藏 reasoning token(即便”加密”)仍可被抓取还原,那厂商宣称的”推理过程保护”并不可靠,隐私承诺需要重估。安全层:泄露出的 API 密钥与凭据说明这类 hidden-reasoning 会话可能沉淀敏感信息,一旦推理记录可被旁路读取,等于把内部凭据暴露给了攻击面。对在用带隐藏推理(reasoning mode)API 的团队,应当把 API 密钥轮换与最小权限列为硬约束。

10. ChatGPT 与 Gemini 双双突破 10 亿月活

The Verge 报道(https://www.theverge.com/ai-artificial-intelligence/978113/chatgpt-gemini-1-billion-users):OpenAI 披露 ChatGPT 月活超 10 亿;皮查伊宣布 Gemini 月活达 10 亿,成为谷歌史上增长最快产品(第 14 个 10 亿里程碑)。

两个主力消费级 AI 产品同月突破 10 亿月活,说明 AI 助手已从”尝鲜”进入”主流通讯级”渗透阶段。对开发者而言,10 亿级用户的产品约等于最大的现实世界指令分布,围绕它们做 Agent/Workflow 集成的生态红利仍在放大。

11. Research Gold:“100% 人类撰写”实为全程 AI 驱动

404 Media(https://www.404media.co/company-offering-100-human-written-never-ai-peer-review-is-entirely-ai)调查发现,号称”100% 人类撰写、绝不使用 AI”的 Research Gold 公司的博士审稿人系 AI 生成且并不存在,客服”Sarah”也是 AI 助手。

这是”AI 透明性合规”和学术诚信方面的反面案例:当一家机构把”无 AI”当作卖点时,恰恰是最该警惕 AI 伪造痕迹的场景。对审稿、人工标注、认证类服务,可验证性(真人身份、流程留痕)应当成为采购时的硬性尽调项,而不是轻信宣称。

四、前沿研究

12. Google AMIE 实时临床视频问诊

Google Blog(https://blog.google/innovation-and-ai/models-and-research/google-research/amie-video-consultations)展示 AMIE 首次具备实时临床视频问诊能力,基于 Gemini 与 Project Astra 构建,可解读视觉听觉线索、引导虚拟体格检查并实时诊断推理。这是”医疗多模态 + 实时交互”的里程碑式落地,把医疗 AI 从文本问答推进到了实时视听医患交互层。

13. Ryan Greenblatt:人类级 AI 或于 2032 年前催生失控超级智能

Redwood Research 首席科学家 Ryan Greenblatt 在 Dwarkesh Podcast(https://www.dwarkesh.com/p/ryan-greenblatt)给出的预测:中位预期 2031 年实现自动化 AI 研发;一旦达到人类顶级专家水平,可能一年内完成 4–5 年的 AI 进展,从而借递归自我改进催生失控式超级智能。

这是一线对齐研究者的中心场景预期(而非极端外推),对做 AI 治理、安全评估与长期技术规划的人是重要的背景参照。

14. GitHub Copilot 置于中间人代理之后

Hacker News 热门实践(https://www.lighthousenewsletter.com/p/i-put-github-copilot-behind-a-mitm)——作者通过 mitmproxy 逆向分析 Copilot 网络流量与内部架构,揭示其运行时行为。对想理解 Copilot 客户端如何与云侧交互、做了哪些请求/响应、以及如何做流控的开发者,这是一个可复现的逆向研究路径,也顺带提醒:任何依赖云端补全的 AI 编程工具都隐含流量出口这一审查与安全边界。

小结

今日 20 条动态可以收敛为四条主线:

  • 开源智能体模型密集入局:NVIDIA(30B/3B MoE,1M 上下文)、Meta Muse Glimmer(Apache 2.0)都把”本地可运行的 agent 模型”作为卖点,加上 Nemotron 4 万亿参数传闻,开源阵营在智能体赛道加速。
  • 本地推理与工具链持续降本:LTX-2.5 秒级视频生成、Apple Silicon 虚拟机 90%+ 裸机性能、统一 Radix 缓存,都在把生成与推理的边际成本往下压。
  • 安全边界敲响警钟:加密推理过程可读取 + 62 个 API 密钥泄露,暗示厂商的”推理保护”并不可靠;Research Gold 的”纯人工”造假则是 AI 透明性合规的负面样本。
  • AI 进入 10 亿用户主流时代:ChatGPT 与 Gemini 双破 10 亿月活,配合 Mojo 1.0 与 Gemini DMS 迁移等工具落地,AI 栈正从”演示”走向”规模生产”。

对开发者,优先值得体验的是 Nemotron 3.5 Lightning 的 1M 上下文 + 3B 激活规格与 Muse Glimmer 的 Apache 2.0 授权(无许可掣肘);同时务必把 API 密钥轮换与最小权限作为接入隐蔽推理接口的默认动作。


本文为 AI HOT 日报(2026-08-11)的精选解读,完整 20 条资讯可访问 aihot.virxact.com 获取。

Sources

  1. NVIDIA 开源本地智能体模型 Nemotron 3.5 Lightning — NVIDIA Blog
  2. SGLang Day-0 支持 Nemotron 3.5 Lightning — LMSYS Blog
  3. 英伟达开发万亿参数 Nemotron 4(传闻报道) — IT之家
  4. LTX-2.5 秒级 720P 视频生成(报道) — IT之家
  5. 统一 Radix 缓存:为混合模型前缀缓存构建单一树 — LMSYS Blog
  6. Apple Silicon 虚拟机 GPU passthrough + Llama.cpp 加速 — GitHub(trycua/cua)
  7. Meta Muse Glimmer 登陆 OpenRouter — X(OpenRouter)
  8. Mojo 1.0 正式发布 — Modular Blog
  9. Gemini 助力 Database Migration Service 加速 PostgreSQL 迁移 — Google Cloud Blog
  10. ChatGPT 桌面端支持导入其他智能体工作数据 — X(OpenAI Developers)
  11. ChatGPT 隐藏推理过程中的泄露凭据研究 — The Decoder
  12. ChatGPT 与 Gemini 双双突破 10 亿月活 — The Verge
  13. Research Gold:宣称 100% 人类撰写实为全程 AI 驱动 — 404 Media
  14. Google AMIE 实时临床视频问诊 — Google Blog
  15. Ryan Greenblatt 谈人类级 AI 与失控超级智能预测 — Dwarkesh Podcast
  16. 把 GitHub Copilot 置于中间人代理之后 — Lighthouse Newsletter