易君召
发布于 2026-09-17 / 作者:易君召 / 7 阅读
0

AI Agents & 开源 LLM 简报 (2026年9月17日)

#AI

主题:RSI 一天之内交了三次卷,而"自己优化自己"第一次有了生产环境的账单

今天是一个很难得的日子:RSI(递归自我改进)这个长期停留在论文与愿景里的词,在 24 小时内被三家公司用可验证的工程结果同时接管——智谱让 GLM-5.3 驱动的 Infra Agent 在 10 万张国产芯片上从零搭出一套生产级推理系统,云知声让模型参与自己的后训练闭环并交出反打旗舰的 Flash 模型,小米干脆把 RL 训练过程做成实时直播页面,连失败回滚都摆在明面上。与此同时,另外两条线也在收紧:英伟达正式把 GPU kernel 纳入 Rust 版图,华为在 PyTorch 官网拿到了第一个中国算力平台的入口。Agent 与开源 LLM 的竞争,正在从"谁的模型更强"转向"谁能把自己造出来、并且让全世界看见怎么造的"。


🔥 1. 智谱交卷 RSI 首个成果:GLM-5.3 驱动的 Infra Agent,在 10 万卡国产芯片集群上从零搭出生产级推理系统 — 986 pts

当模型开始优化"运行模型的那套系统",套娃闭环第一次跑进了生产环境。

清华大学计算机系教授、智谱创始人唐杰今天分享了一个内部观察到的 RSI 早期案例:GLM-5.3 驱动的 Infra Agent,在超过 10 万张国产芯片组成的集群上,从零参与搭建并优化了一套生产级推理系统。不到两周,端到端吞吐提升至初始基线的 3.2 倍

算子精度问题,到 Python/C++ 跨层并发瓶颈,再到 Kernel 性能优化,Agent 已能自己读取系统反馈、提出假设、修改代码、跑实验,再根据结果继续迭代。两个具体战绩最能说明问题:它定位出 KV Transfer 场景中 Python GIL 导致的并发阻塞,把 Prefill+KV Transfer 相比单独 Prefill 超过 20% 的性能损失压到 1% 以内;在 KDA Decode 算子上通过重新组织计算拿到 1.71× 提升。

唐杰概括为:模型优化系统,系统承载模型。 技术栈同样硬核:节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合精度缓存量化、Layer Split,以及 Encode–Prefill–Decode(EPD)分离式架构,硬件利用效率与单 Token 成本均达主流 NVIDIA GPU 相当水平。GLM-5.3-Flash 以匿名模型 "Ox-Alpha" 在 OpenCode 与 OpenRouter 接受真实调用检验,上线一周成为双平台调用量最大模型,6 天 token 超 62 万亿

但必须记下智谱的克制:明确强调还没有实现 RSI,目标设定、边界划定、风险判断仍由人类工程师负责。另一条时间线也值得注意——2025 年 10 月启动安全能力增强研究,不到一年,安全伙伴用 GLM 在真实代码库中发现数千个漏洞,"带来了过去不曾存在的危险",为此不得不设计受信访问计划。

https://www.qbitai.com/2026/09/491357.html


🔥 2. 英伟达正式发布 CUDA Rust:GPU kernel 第一次也归 Rust 管 — 962 pts

系统层早就 Rust 化了,只剩 kernel 这块硬骨头——现在补上了。

NVIDIA 在 9 月正式宣布认真押注 Rust 原生 GPU 编程。CUDA C++ 和 CUDA Python 已是成熟商用工具链,而 CUDA Rust 被明确规划到 2027 年及以后持续打磨——是长期养生态,不是试水。官方博客《Introducing CUDA Rust: Two Tracks for Writing GPU Kernels》由 Sri Koundinyan、Melih Elibol、Jonathan Bentz 撰写。

驱动这个决定的是向下看的视角。AI 的系统层——推理引擎、serving 基础设施、驱动、agent 运行时——越来越多用 Rust 写,因为它能在编译期拦掉整类 bug 又不牺牲性能。NVIDIA 自己就是潮流的一部分:Nova Linux 驱动用 Rust 写,Dynamo 的核是 Rust,NVTX 有 Rust 绑定。唯独一个例外——GPU kernel。这次就是要堵上这个口子:让 kernel 也能直接用 Rust 写、原生编译成 PTX

两条平行路径:SIMT 路线 cuda-oxide——自定义 rustc codegen 后端,#[kernel] 函数经 Rust MIR、社区 Pliron IR、LLVM IR 一路下到 PTX,cargo oxide run 能把完整 vector add 跑通打印 PASSED: all 1024 elements correctTile 路线 cutile-rs——按 tile 而非标量计算,编译器决定背后用多少真实 GPU 线程,门槛更轻(稳定 Rust 1.89+、CUDA 13.3、Linux,已在 crates.io 发布)。

最值得看的是编译器能抓到什么:几千个线程无固定顺序碰到同一 buffer,一旦两个线程同时写同一地址,这类 bug 往往过了测试才在生产炸开。两条路都在编译期不给通过——SIMT 侧是 E0502(可变借用与不可变借用冲突),Tile 侧是 E0382(move 了已使用的值)。

https://developer.nvidia.com/blog/introducing-cuda-rust-two-tracks-for-writing-gpu-kernels/


🔥 3. 小米把 MiMo 2.6 的后训练过程实时直播出来:36 小时烧掉 108 万美元,失败回滚全公开 — 938 pts

以前厂商给世界看训完那一下的数字,小米把中间过程也摊开了。

小米 MiMo 大模型团队在官网挂出后训练实时数据面板:打开 mimo.xiaomi.com/rl/,能看到 pro 和 flash 当前跑到第几步、每步接受多少样本、花了多少钱、燃烧多少 token,全部实时滚动。

钱是最直接的叙事。 从 pro 开始训练算起 36 小时,两款模型已花超过 108 万美元,平均每小时 3 万美元——按面板读数 pro 约 83 万、flash 约 36 万,两边都以 1,568×16 批次规模在跑。更罕见的是连翻车都不藏:flash 昨天因数据集基础设施错误未被及时检测,从第 15 步重启;pro 也因某节点 VRAM 问题重启过一次。

性能实时更新,DeepSWE v1.1(mini-swe-agent,avg@3):pro 63.72、flash 60.77,并画了随 step 变化的曲线。罗福莉在 X 上解释半年沉默:"近半年沉默,我们只用来研究一个问题——RL 到底能扩展到多远。"三块扩张很明确:算力(每步约 20 亿 token,全异步 Fully Async)、环境和 harness(多任务 agentic RL,一次训练混合代码/通用/视觉/Chat 并同时跑多个 harness)、grader 算力(agentic 组内 credit 分配,测试用例 + rubric 两种奖励)。把 open 玩到了另一种维度:不只是开源权重,连"怎么把它训出来"都变成公开可观看的节目。

https://mimo.xiaomi.com/rl/https://www.qbitai.com/2026/09/490950.htmlhttps://www.oschina.net/news/502540/xiaomi-mimo-rl-live-dashboard


🔥 4. 华为全联接大会 2026:全球首个 NPO 超节点昇腾 960 发布,昇腾成为 PyTorch 官网可直接安装的首个中国算力平台 — 915 pts

硬件上赌 NPO 光互联,生态上赌开源与 PyTorch 兼容。

华为全联接大会 2026 今日在上海启幕,轮值董事长汪涛发表"打造智能世界的硅基黑土地"主题演讲。硬件侧,发布全球首个采用 NPO 技术的超节点——昇腾 960:单超节点 4096 卡8EFLOPS FP8 / 16EFLOPS FP41PB HBM。用 5500 个自研 Hi-ONE 替代原本需要的 4 万 8 千颗 800G 光模块,功耗降低超 550 千瓦,系统可用度 99.8%;Hi-ONE 单引擎 7.2T,业界首个量产 NPO、唯一内置光源。关键数字:4K 超节点组成的 10 万卡集群,相比 8 卡服务器同规模集群,MFU 提升 2.75 倍。

配套成体系:鲲鹏超节点最大 4096 节点、256TB 统一内存池,十万级 Agent 沙箱启动快 30 倍OceanStor M900 多层 KV Cache 方案使 SSD 读写寿命提升 16 倍。最大集群规模 51.2 万卡,结合多轨道拓扑最大支持 100 万卡

生态侧最值得看:鲲鹏开发者超 416 万、伙伴超 7200 家,openEuler 装机量超 2000 万套;昇腾 CANN 常态化开源,外部开发者占比首次超过内部达 61%,已覆盖 PyTorch、Triton、vLLM、veRL 等 90 多个社区。最实在的一条:在 Linux 基金会支持下,昇腾正式成为可在 PyTorch 官网直接安装的算力平台,是首个来自中国的算力平台。

同场《智能世界2035》首次提出十大关键命题:列出面向智能体的 Agent OS(能力为"(协同力×执行力×记忆力×连接力)^演进力");预测 2035 年全球年度 Token 消耗增长 10 万倍,智能体流量占比超 90%,未来五年 AI 累计创造超 27 万亿美元。汪涛收尾克制:"愿景不会因描绘而自动实现,行动才是丈量未来的尺度。"

https://www.oschina.net/news/502544/hc-ascend960-supernodehttps://www.oschina.net/news/502545https://www.oschina.net/news/502546/huawei-hc-intelligent-world-2035


🔥 5. 国产 RSI 交卷:云知声 U2-Flash 用 266B 总参 / 10B 激活的稀疏 MoE,把上一代旗舰甩在身后 — 891 pts

Flash 默认是"旗舰平替",这次它把旗舰超了。

"港股 AGI 第一股"云知声发布 U2-Flash,率先交出国产 RSI 早期答卷——后训练闭环里模型已深度参与自身演进:生成训练数据、分析执行轨迹、巡检和修复训练系统

按惯例 Flash 是"旗舰平替",更快更便宜但能力打折。U2-Flash 速度与成本优势没含糊(相比 U2 生成速度快 2.1 倍、Agent 任务完成时间缩短 35%、迭代步数与 Token 消耗降 20%–30%),但能力不仅没打折反而反超:DeepSWE v1.1 从 32 冲到 64.6(翻倍)、TerminalBench 3.0 从 2.7 飙到 24.3(9 倍)、SWE-Bench Pro 61.6(+10.5)

更值得关注的是智能密度:稀疏 MoE 总参数约 266B,单次推理只激活约 10B(不到 4%),部分表现闯进万亿参数级模型所在区间——把 Flash 的"不可能三角"直接掀了。落地细节:API 同时兼容 OpenAI 与 Anthropic 两套协议,Claude Code、Trae、Cursor、Cline 官方给了接入方式;提供 none/low/high/max 四档思考强度,512K 上下文;当前限时六折(输入 0.6 元、输出 1.2 元、缓存命中 0.12 元每百万 Tokens),并宣布 9/15–9/30 人人可免费领取 1 亿 Tokens

一项测试很有意思:在虚构的 ExpenseFlow 报销项目中故意埋了三个坑(已驳回报销混入总额、北京时间凌晨记录存成 UTC 后串月、CSV 导出日期串月),不透露线索只下了一句"请独立完成发布前验收"——它用 7 分 6 秒准确揪出全部问题。当 Flash 档位开始具备"自己找 Bug"的能力,Agent 的算力账本会被重算一遍。

https://www.qbitai.com/2026/09/491091.html


🔥 6. Anthropic 合并 Chat 与 Cowork,原生 Claude Docs 与 Claude Slides 上线 — 868 pts

硅谷在做中国半年到一年前做过的事,只是路径是"从 AI 出发重建办公软件"。

Anthropic 宣布把 Cowork 与 Chat 合并为一个入口,并新发 Claude DocsClaude Slides。统一入口分批上线(Pro/Max 率先,Team/Free 随后);Docs、Slides 及对话界面的 Claude Design 暂处 Beta,仅付费订阅开放,Enterprise 版需管理员开启。

理解这个合并要先看 Cowork:它今年 1 月从 Claude Code 孵化,定位"Claude Code for the rest of your work"——四个工程师 10 天做出来,大部分代码还是 Claude Code 自己写的。但很多用户不知道任务该放哪个界面,且上下文跨产品接不上,于是合并为一个入口,聊天/Cowork/Artifacts 同窗出现,用户只描述目标,Claude 自行判断直接回答还是调复杂能力。示例很具体:让 Claude 拉上周数据、找进度落后项目、按团队格式写报告、再压成 5 页汇报 PPT;即使用户合上电脑,也能稍后用手机查看进度,报告与 PPT 来自同一次对话,无需再复制给另一个 AI 重新理解。

Claude Docs 支持共同编辑、选中提问与评论;Claude Slides 负责生成编辑演示,可直接播放或导出 PowerPoint/PDF;作品均可生成分享链接在手机上编辑。

竞争格局已分野:OpenAI 走"超级应用"(7 月把 Codex 并入 ChatGPT 桌面端,推出 ChatGPT Work,Atlas 浏览器已停止作为独立产品);谷歌最省事(Gemini 深度嵌入 Gmail/Docs/Workspace);Anthropic 是从 AI 出发重建办公软件,把 Claude 做成唯一入口。量子位的评价颇为辛辣:这套 AI 原生办公套件,国内可能比硅谷早了半年到一年

https://www.qbitai.com/2026/09/491391.html


🔥 7. Claude Code 团队自述:70%–80% 日常工作交给 Claude Tag,"信任比监督更重要" — 846 pts

一份关于"人机协作颗粒度上移"的罕见一手材料。

Claude Code 团队发布访谈《How the Claude Code team uses Claude Code》。第一,交接比例:当前已将 70%–80% 日常工作交给 Slack 原生 AI agent——Claude Tag。而一年前工程师还在逐行阅读 AI 的工作记录(每次工具调用、每个参数选择、每步推理决策)。现在核心理念是不再逐条审视 tool call,而是下达一个 goal 让模型自行达成。他们把 UI 与模型思考记录彻底解耦——AI 的内部独白被隐藏,人类只看到 Claude 调用发消息工具的结果。团队承认这是一种"有点吓人的强制性放手"

第二,一个内部工具开发案例:先问 Claude Tag"我有这个点子,该找谁聊?"→ 交付 stakeholder 名单;聊完直接让它做原型与实现;再加埋点部署到内部使用,观察反馈;此后它持续监控使用数据,收到反馈就主动提醒负责人,并让它"去改进这个转化漏斗,你自己想想办法"。

第三,"不恋战"的工程哲学:前提是底层模型能力每两个月发生一次根本性跃迁——"技术的地基每两个月就会在你脚下发生根本性变化"。因此准则为"你必须对自己造的东西保持非常不执着的态度":很多写进 harness 的功能本质是弥补当时模型短板,模型变强就要立刻拿掉。两个案例:to-do list 在 Sonnet 3.5 阶段是救命功能,一年后模型具备更强记忆能力,脚手架被拆除;AskUserQuestion 最初为让 Claude 中途提问而设计,后来转向让 Claude 直接生成带图表和 mockup 的可视化 artifact 来提问。

应对方法是不再构建固定方案,而是搭可自由组合的"原语"(primitive):Permissions、Visualizations、Verification、Code Review、Feedback……原语过时替换代价更小,层层叠加往往涌现新能力。结论干净利落:"软件工程是「变化的职业」。你解决的问题在变,但核心始终是 problem solving。"

https://www.qbitai.com/2026/09/491596.html


🔥 8. 央企第一次进前三:中国电信 TeleAgent 在 IDC 首份企业级通用 Agent 评测中拿下第三 — 823 pts

底层模型已经很难解释全部差距;胜负越来越取决于模型外围那整套工程系统。

IDC 发布国内首份《中国企业级通用 Agent 产品技术评估》,中国电信的 TeleAgent 排进国内前三。IDC 没用大模型 Benchmark,而是拿近百道非公开任务考察 Agent 在真实办公环境能否把事做完——测试重点放在端到端把事情办完上,任务既含邮件、日程、文档处理,也含长上下文、多步骤循环、复杂 PPT、表格处理与浏览器操作。有些题目很接近真实工作:处理 3755 行脏数据,或从约 3 万字材料提炼内容生成 11 页 PPT。跑完还会核验系统状态和最终文件

成绩:TeleAgent 常规任务 3.49 分、复杂任务 3.36 分;九项能力中任务表现拿到 5 分满分,成本效率为此次测评最高分。今年 4 月桌面端还在内部试用,7 月 V1.0 对外推出,一个多月用户规模已接近 120 万

IDC 专门提到 Agent Harness——围绕大模型搭起的整套执行系统:安排上下文、调度工具、保存任务状态、控制执行环境;异常时判断重试/换路径/恢复进度;结果生成后检查是否完成。这些能力在短任务里不一定明显,可任务一旦拉长,差距就会被迅速放大。

TeleAgent 的高分项可沿这条链路拆解:上下文先对低价值旧工具输出轻量剪枝,过长则由专门压缩模型处理整段内容,并实时监测窗口,目前上下文窗口已突破 400K记忆加了 autoDream 长期记忆,定期整理近期对话并合并新信息,使项目背景与用户习惯跨会话保留。内核方面没有直接套用现成 Coding Agent 框架,核心含约 3 万行自研 Go 代码,还专门处理了 Windows PowerShell、麒麟、统信等系统兼容性——毕竟做 PPT、写报告、处理 Excel,和在代码仓库里找 Bug 是两套截然不同的工作方式。

https://www.qbitai.com/2026/09/491454.html


🔥 9. RISC-V 第一次"开箱即用"跑本地大模型:deepin 25 RVA23 适配进迭时空 K3,单 SoC 可跑 300 亿参数 — 802 pts

桌面操作系统的"开箱即用"四个字,这次落到了 RISC-V 上。

deepin 官方披露:在 deepin-ports SIG 协助下结合 Next (RVA23) 仓库,deepin 25 已适配进迭时空(SpacemiT)K3,并在其上顺利运行本地 AI 模型版本的小U同学(原 UOS AI)——RISC-V 平台上的桌面操作系统第一次真正具备"开箱即用"的本地大模型能力

K3 是前提:全球首批完整符合 RISC-V RVA23 规范的 AI 计算平台之一,单颗 SoC 集成两类核心——8 颗 X100 通用核(4 发射乱序执行,SpecINT2006 大于 9.0/GHz,最高 2.4 GHz,8 核共享 8MB L2,整机约 130 KDMIPS);8 颗 A100 AI 核(自研 IME 矩阵运算扩展指令集,8 核合计约 60 TOPS INT4 稀疏,可流畅运行最高 300 亿参数模型,30B 下推理速度 >10 tokens/s),与通用 CPU 共享同一编程模型,无需额外算子转换开销。另有 2 颗 RT24 实时核,形成"通用 + AI + 实时"三域协同,典型功耗仅 15–25W

软件栈才是硬功夫:deepin-ports SIG 持续维护面向 K3 的 6.18 内核分支和 u-boot;系统侧依托 deepin-ports-image 打包机制追随主线;图形侧同步适配 GPU 驱动与固件并实机测试通过。用户可在 deepin-ports 镜像列表下载 K3 体验镜像。

Next 仓库则为新一代硬件提升基线:传统 deepin 25 主线基于 RVA20,组件版本已无法满足 RVA23 新硬件需求,故提出独立 Next 仓库(RFC 见 deepin-community/rfcs#18),同时启用 amd64/arm64/riscv64/loong64 四架构构建,并针对 riscv64 开启 RVA23 全局优化,工具链整体升级(GCC 15 默认 + 16,可直接通过标准 -march 开启相关指令集)。当"开源 LLM 跑到本地"从 x86/ARM 扩展到 RISC-V 并进入桌面发行版主线,端侧智能的硬件底座就不再只有一条路。

https://www.oschina.net/news/502538


🔥 10. vivo 给手机装上 Harness:蓝心大模型端云矩阵与"大模型+Harness"个人智能底座 — 781 pts

手机面对的已经不只是一道模型能力题,而是一道关于感知、记忆、调度、执行和协同的系统题。

2026 vivo 开发者大会(VDC)人工智能分会场,vivo 给出的路径是:以"大模型+Harness"构建个人化智能底座,重构 OS 体验。

问题意识很具体:AI 能力更强,并不意味着用户体验更好。一条航班延误通知弹出,AI 能总结内容、回答晚点多久;但往下处理立刻复杂——转机要不要改、酒店会不会受影响、明早的会还能不能赶上。更麻烦的是它未必记得你的习惯:愿不愿意坐凌晨航班、在不在意多花几百块。这解释了 AI 手机越来越明显的落差:模型能力一路上涨,Benchmark 卷得飞起,但手机端体验并没有自动升级。

一台手机想真正替用户把事情接过去,还得在授权与隐私保护前提下看懂此刻发生了什么、记得此前发生过什么,再调动合适的模型、上下文、App 和服务把事一环接一环做完。手机面对的不是模型能力题,而是关于感知、记忆、调度、执行和协同的系统题。

vivo 的解法是异构调度——借用芯片行业的答案:CPU 通用控制、GPU 并行计算、NPU 专做 AI、ISP 负责图像,系统按任务动态分配。不是让最强的单元干所有活,而是让最合适的单元干最合适的活。 落到模型上即「蓝心大模型端云矩阵」:BlueLM-Realtime(端到端语音,从识别到理解语义语气意图)、BlueLM-Nano(端侧,承担长期驻留的感知与记忆)、BlueLM-Flash(云侧,信息查询/日程/跨 App 高频场景)、BlueLM-Pro(复杂推理与长程规划),进入专业领域还能自动调动外部顶尖模型补位。于是模型开始"组团"——从需要用户主动选择的产品,退到后台成为被系统自动调度的基础能力

vivo 也点出了第二道更难的题:人,本身就是一种"不断变化"的上下文——要懂当下也要懂过去。随之而来的是隐私与权限边界:想越用越懂你就得持续感知并积累日程、位置、操作习惯等个人上下文,但感知越广、记忆越长,隐私压力越大。个人 AI 真正难的地方,是同时解决两件看似矛盾的事——既拥有足够连续的个人上下文,又让这些感知和记忆始终运行在明确的授权边界内。 这与本期华为把 Agent OS 列入十大命题、IDC 强调 Agent Harness 构成同一条技术叙事。

https://www.qbitai.com/2026/09/491649.html

📌 今日趋势总览

趋势方向

代表事件

热度

RSI 从愿景变成工程账单

智谱 GLM-5.3 Infra Agent(10万卡国产集群、3.2× 吞吐)· 云知声 U2-Flash · 小米 MiMo 2.6 RL 直播

🔥🔥🔥🔥🔥

Agent Harness 成为胜负手

Claude Code 团队自述(70–80% 交给 Claude Tag)· 中国电信 TeleAgent IDC 前三(3 万行自研 Go 内核)· vivo 大模型+Harness

🔥🔥🔥🔥🔥

算力底座与生态入口之争

华为昇腾 960 NPO 超节点(百万卡)· 昇腾进入 PyTorch 官网(首个中国平台)· NVIDIA CUDA Rust

🔥🔥🔥🔥

AI 原生办公套件成型

Anthropic 合并 Chat/Cowork + Claude Docs/Slides · OpenAI Super App · Google Gemini in Workspace

🔥🔥🔥🔥

端侧智能硬件多元化

deepin 25 + 进迭时空 K3(RISC-V RVA23,30B >10 tok/s,15–25W)· vivo 蓝心端云矩阵

🔥🔥🔥

评测范式从"分数"转向"交付"

IDC 近百道非公开任务 + 文件核验 · 小米直播 DeepSWE 实时曲线

🔥🔥🔥


本文原创作者:易君召,详见:https://www.yijunzhao.cn/authors/yijunzhao,转载请注明出处。

原文链接 https://www.yijunzhao.cn/archives/ai-agents-open-source-llm-briefing-2026-09-17

欢迎访问 小易撩挨踢

https://www.yijunzhao.cn/