开源模型与端侧 AI:AI 普惠的两条腿
前几篇笔记聊了 Agent、世界模型和协议,这篇补上「底座」的部分:开源模型和端侧 AI。它们共同回答了同一个问题——AI 怎么才能更便宜、更普及。
先说说那只「龙虾」OpenClaw
2026 年以来最炙手可热的全球 AI 产品,是开源 AI 智能体 OpenClaw——因为图标是一只红色龙虾,圈内都叫它「龙虾」。它是现象级的:微信聊天可以直接唤醒智能体工具,千问 App 一句话完成打车、点餐。
圈内评价:「龙虾重新定义了用户与大模型的交互方式。它与大模型的关系,就像浏览器之于互联网。」——中国人民大学高瓴人工智能学院副教授 林衍凯
「龙虾」爆火的背后,是基座模型核心能力的进化:工具调用、结构化输出、长上下文理解、复杂推理——这些正是为 Agent 时代准备的能力。
MoE:标配化的架构
MoE(混合专家)的核心思想一句话讲完:总参数很大保知识,激活参数很小省算力。2026 年,MoE 架构、多模态融合、超长上下文几乎成为新一代基座模型的标配,「智能密度」竞赛取代了单纯的「参数竞赛」。
以阶跃星辰 Step 3.5 Flash 为例:总参数量 1968 亿(196B),但每个 Token 只激活约 110 亿(11B)参数——相当于用「11B 级别的运行速度」提供「196B 级别的思考深度」。实测 AIME 2025 数学推理 97.3 分、SWE-bench Verified 代码修复 74.4%,超过了部分更大的闭源模型。
| 技术组件 | 实现方式 | 意义 |
|---|---|---|
| MTP-3 多 Token 预测 | 3 路并行预测,一次生成 4 个 Token | 大幅降低 Agent 任务链条延迟 |
| 混合注意力 | 滑动窗口 : 全局注意力 = 3 : 1 | 支撑 256k 长上下文,省显存 |
| 细粒度 MoE | 288 路由专家 + 1 共享专家,Top-8 选择 | 复杂数学、编程任务更稳定 |
| 吞吐量 | 典型 100–300 tok/s,峰值 350 tok/s | 复杂推理链条「即时响应」 |
国产开源三强对比
2026 年的春节档成为分水岭——智谱、MiniMax、阶跃星辰、阿里、字节、小米陆续推出面向 Agent 需求的新一代基座模型。其中开源阵营最具代表性的三家:
| 模型 | 规模 | 杀手锏 |
|---|---|---|
| 阶跃星辰 Step 3.5 Flash | 196B 总参 / 11B 激活 | 智能密度:数学与代码推理抢眼 |
| 月之暗面 Kimi K2 | 1T 总参 / 32B 激活 | 超大规模下的长文档处理与逻辑严密性 |
| 阿里 Qwen 3 | 系列化 | 支持 358 种编程语言,开发者首选代码 Agent 基座 |
这种「百花齐放」打破了闭源模型的权力垄断,为垂直行业 Agent 的试验提供了低门槛的基座。
端侧革命:Agent 本地跑
Agent 爆发的另一大推力来自硬件。2026 年,AI 不再只运行在云端 GPU 集群上,开始大规模进入个人电脑:
- 苹果 M5 芯片:每个 GPU 核心内置「神经加速器」,AI 峰值算力较 M4 提升 4 倍以上;基础版统一内存带宽 153 GB/s,M5 Max 预计超 550 GB/s——带宽正是本地推理的第一瓶颈。
- 本地能跑什么:128GB 以上统一内存的设备,可流畅运行 7B–30B 参数级模型,零延迟、零 API 费用、数据不出本机。
本地 Agent 的三个典型场景:私有代码库管理(断网环境下索引、重构项目)、敏感文档处理(合规审查不出本机)、个人自动化管家(静默监控邮件日历,自主完成日程与摘要)。
推理成本:还在跳水
推理优化远未触顶。通过算法创新与硬件变革,推理成本持续下降、能效比不断提升,这让在资源受限的边缘设备上部署高性能模型成为可能。
我的总结:开源模型拉低「入场费」,端侧硬件拉低「使用费」,推理成本跳水让两者叠加生效——这就是 AI 普惠的两条腿。所谓「AI 技术泡沫」的讨论,在这条持续下降的成本曲线上,大概率是个假命题。