2026年7月,中国大模型迎来"双雄对决":
- 7月16日:月之暗面发布 Kimi K3,2.8万亿参数
- 7月19日:阿里通义发布 Qwen3.8-Max-Preview,2.4万亿参数
两个模型几乎同时发布,参数量都突破2万亿,都宣称对标 Claude Fable 5,都承诺即将开源。
本文基于官方信息,从技术架构、性能表现、生态定位三个维度,深度对比这两大国产旗舰模型。
第一部分:Kimi K3 技术深度解析
2026年7月16日晚,月之暗面(Moonshot AI)发布了新一代旗舰模型 Kimi K3。没有发布会,没有预热海报,K3 直接上线,API 同步开放。
2.8万亿参数、100万上下文窗口、全球首个开源3T级别模型——每一个数字都足够成为头条。但真正值得技术人深挖的,是它背后的架构创新。
一、基础参数(官方确认)
| 参数 | 官方数据 | 备注 |
|---|---|---|
| 总参数量 | 2.8 万亿(2.8T) | 全球首个开源 3T 级别模型 |
| 上下文窗口 | 100 万 token | 官方明确,部分媒体称 400 万为误传 |
| MoE 架构 | 896 个专家,激活 16 个 | 激活比例 <2% |
| 多模态 | 原生视觉理解 | 文本、图像、视频统一架构 |
| 开源时间 | 2026年7月27日前 | 完整权重开源 |
| 发布时间 | 2026年7月16日晚 | 无发布会,直接上线 |
二、核心架构创新
K3 的架构创新可以概括为三大支柱:KDA 混合线性注意力、AttnRes 注意力残差、Stable LatentMoE 专家路由。
2.1 KDA(Kimi Delta Attention)— 混合线性注意力
问题背景
传统 Transformer 的自注意力机制计算复杂度为 O(n²),当上下文扩展到 100 万 token 时,这是一堵难以逾越的墙。业界已有多种尝试:
- FlashAttention:硬件级算子融合,降低常数因子,但未改变平方复杂度
- Ring Attention:序列并行分摊计算,本质仍是工程优化
- Mamba/SSM:状态空间模型,推理极快但上下文建模弱
- RetNet/RWKV:线性注意力方案,但精度上限受限
KDA 的设计哲学
KDA 走的是一条不同的路:在注意力计算的核心环节做架构级替换。
核心思路分三步:
- Delta 压缩:不直接计算完整的 QK^T 矩阵,而是通过 Delta 函数对 Query-Key 交互进行稀疏化压缩
- 线性近似:在保持关键注意力模式的前提下,将复杂度降至 O(n)
- 残差补偿:对压缩过程中丢失的高频细节,通过轻量级残差连接进行补偿
关键配置(官方确认)
| 配置 | 说明 |
|---|---|
| 3:1 混合布局 | 每 4 层中,3 层使用 KDA 线性注意力,1 层保留全局 MLA(Gated MLA) |
| KV 缓存削减 | 最多减少 75% |
| 解码加速 | 100 万 token 上下文下最高 6.3 倍 |
与现有方案对比
| 方案 | 核心机制 | 优势 | 劣势 |
|---|---|---|---|
| Mamba (SSM) | 状态空间模型 | 极快推理 | 上下文建模弱 |
| RetNet | 多尺度保留 | 训练推理统一 | 长文本退化 |
| RWKV | RNN 式线性注意 | 低资源高效 | 精度上限低 |
| KDA | Delta 压缩 + 残差 | 精度接近 softmax | 训练复杂度略增 |
KDA 的关键突破在于:它不是简单地用线性函数替代 softmax,而是通过 Delta 压缩保留注意力矩阵中的关键模式,再用残差补回细节。这使得 K3 在 100 万上下文下的注意力质量明显优于纯线性注意力方案。
2.2 AttnRes(Attention Residuals)— 注意力残差
问题背景
传统 PreNorm 残差连接把历史层输出按固定权重 1 累加。网络越深,单个新层在 residual stream 中的相对贡献越可能被稀释。
AttnRes 的核心思想
AttnRes 让当前层对历史层表示计算 softmax 权重,按输入选择更有用的早期表示,而非均匀累积。
两种版本:
| 版本 | 特点 |
|---|---|
| Full | 关注所有历史层 |
| Block | 多层压成块摘要,块内普通累加,块间选择性读取 |
官方数据
- 额外成本:<2%
- 训练效率提升:~25%
注意:官方坦承"尚无独立论文完整披露机制细节",第三方理解依赖技术博客与演讲的零散信息。
2.3 Stable LatentMoE — 稳定专家路由
在 896 个专家的极端稀疏度下,路由和优化成为一阶挑战。K3 采用四项技术确保稳定训练:
| 技术 | 作用 |
|---|---|
| Quantile Balancing(分位数平衡) | 从 router-score 分位数直接推导专家分配,消除启发式更新和敏感的平衡超参数 |
| Per-Head Muon | 扩展 Muon 优化器,独立优化注意力头,实现更自适应的学习 |
| SiTU(Sigmoid Tanh Unit) | 改进激活控制 |
| Gated MLA | 改进注意力选择性 |
效果:整体扩展效率较 Kimi K2 提升约 2.5 倍。
三、训练与推理优化
| 技术 | 说明 |
|---|---|
| 量化感知训练(QAT) | 从 SFT 阶段开始使用 MXFP4 权重 + MXFP8 激活,降低显存占用 |
| 完全均衡专家并行 | 静态计算图,关键路径无需主机 CPU 同步,避免通信阻塞 |
| 推荐部署 | 64+ 加速器的 supernode 配置 |
| vLLM 贡献 | KDA 推理优化实现已贡献给 vLLM 社区 |
| 缓存命中率 | 编程工作负载下 >90%(Mooncake 分离式推理架构) |
四、性能评测(官方数据)
4.1 编程能力
| 榜单 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | 备注 |
|---|---|---|---|---|
| Frontend Code Arena | 1679 | 1631 | 1618 | 全球第一,7 个细分领域 6 个第一 |
| DeepSWE | 67.5% | — | — | 第三 |
| SWE Marathon | 42.0 | — | — | 第一(Fable 5 有 35% fallback) |
| Terminal-Bench 2.1 | — | — | — | 第二 |
4.2 综合能力
| 榜单 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Artificial Analysis 智能指数 | 57 | 60 | 59 |
| GDPval-AA v2 | 1687 | — | — |
4.3 官方坦诚
"While its overall performance still trails the most powerful proprietary models, Claude Fable 5 and GPT 5.6 Sol, Kimi K3 demonstrated frontier-level performance across our evaluation suite."
K3 在编程等特定维度达到前沿水平,但综合体验与最强闭源模型仍有明显差距。
五、API 定价
| 类型 | 美元价格 | 人民币价格 |
|---|---|---|
| 缓存命中输入 | $0.30/MTok | ~2元/MTok |
| 缓存未命中输入 | $3.00/MTok | ~20元/MTok |
| 输出 | $15.00/MTok | ~100元/MTok |
横向对比:
| 模型 | 输出价格 | 对比 |
|---|---|---|
| Claude Fable 5 | ~$50/MTok | K3 约为其 60% |
| GLM-5.2 | ~$6/MTok(30元) | K3 约为其 3 倍 |
| K2.6(上一代) | ~27元/MTok | K3 涨 3.5 倍 |
六、信息冲突澄清
基于官方信息,以下媒体传播存在误差:
| 冲突点 | 官方信息 | 媒体误传 |
|---|---|---|
| 上下文窗口 | 100 万 token | 部分称 400 万(误传) |
| 发布时间 | 7月16日晚 | 有称 7月15日、17日 |
| 综合排名 | 全球第三 | 有称"全面超越"(不准确) |
| 与 Fable 5 对比 | "仍有明显差距" | 有称"全面超越"(错误) |
| 开源状态 | 7月27日前开源完整权重 | 有称"已完全开源"(不准确) |
七、已知限制(官方披露)
-
对思考历史敏感:如果 agent harness 未正确传递历史思考内容,生成质量会不稳定。推荐使用验证过的兼容 harness(如 Kimi Code),避免中途切换模型。
-
过度主动:K3 的训练特别强调长程挑战性任务,遇到小问题或模糊意图时可能代替用户做出意外决策。
-
综合体验差距:与 Claude Fable 5、GPT-5.6 Sol 相比仍有明显差距。
八、市场反应
| 事件 | 详情 |
|---|---|
| 上线48小时 | 用户请求量"大幅超出预估",暂停新用户订阅 |
| 马斯克评价 | "Impressive"(令人印象深刻) |
| 马斯克回应 | 宣布 Grok 4.6(2万亿参数)将于下周完成训练 |
| Kimi 回应 | "欢迎加入「2万亿+」俱乐部" |
| 资本市场 | A股"Kimi概念"涨停潮,美股半导体板块一度重挫 5.7% |
九、总结
Kimi K3 的核心价值不在于"参数最大",而在于:
- 架构创新:KDA + AttnRes 为万亿级模型提供了新的 scaling 路径,2.5 倍的扩展效率提升证明了架构设计的重要性
- 开源意义:首个 3T 级别开源模型,打破闭源垄断,为全球开发者提供万亿级模型的应用可能
- 编程能力:Frontend Code Arena 全球第一,中国大模型首次登顶该榜单
- 诚实定位:官方坦承综合体验仍落后于最强闭源模型,这种态度值得肯定
K3 证明了一件事:高性能大模型不一定需要天价算力,并且可以开源自行部署。正如 Arena 榜单运营负责人所说,K3 的发布"或将倒逼投资者重新审视整个 AI 行业"。
第二部分:Qwen3.8-Max-Preview 技术解析
一、基础参数
| 参数 | 官方数据 | 备注 |
|---|---|---|
| 总参数量 | 2.4 万亿(2.4T) | MoE 混合专家架构 |
| 上下文窗口 | 200K / 400K / 1M | 三档可选 |
| 多模态 | 原生多模态 | 文本、代码、图像、视频统一处理 |
| 推理模式 | 思考模式 / 快速模式 | 双模式自由切换 |
| 发布时间 | 2026年7月19日 | 预览版上线 |
| 开源状态 | 即将开源 | 正式版发布后开放完整权重 |
二、核心能力
根据阿里云开发者社区的官方介绍,Qwen3.8-Max-Preview 的核心能力包括:
2.1 MoE 混合专家架构
- 2.4T 总参数,海量专家子模块
- 根据任务类型动态路由分配算力
- 官方称"同等 Token 消耗下推理精度提升 25%,长文本幻觉问题降低 62%"
2.2 双推理模式
| 模式 | 特点 | 适用场景 |
|---|---|---|
| 思考模式 | 分步拆解、自动校验、极致准确 | 数学运算、代码编写、文档解析 |
| 快速模式 | 精简推理、高并发、低成本 | 批量文案、短视频脚本、轻量问答 |
2.3 五大场景优化
- 复杂工程开发:大型项目重构、算法编写、单元测试
- 长文档深度分析:十万字报告、合同、白皮书全文解析
- 多步骤智能体自治:自动规划工具调用、自主修正错误
- 跨境多语言创作:数十种语言互译、本地化表达
- 海量数据挖掘:行业数据分析、商业洞察
2.4 技术细节(待补充)
注意:截至本文撰写时,Qwen3.8-Max-Preview 的官方技术报告尚未发布。以下信息基于官方介绍和第三方分析:
- 具体 MoE 专家数量、激活策略:未披露
- 注意力机制细节:未披露
- 训练数据和方法:未披露
- 详细 Benchmark 数据:未完整披露
官方称"综合推理水准对标海外顶级 Fable 5 模型",但这一说法基于内部评估,尚无第三方验证。
三、API 定价
| 套餐 | 价格 | Credits 额度 | Agent 并发 |
|---|---|---|---|
| Lite | 39元/月 | 2500/7天 | 1-2个 |
| Standard | 139元/月 | 10000/7天 | 3-4个 |
| Pro | 499元/月 | 40000/7天 | 6-8个 |
特点:Token Plan 订阅模式,统一 Credits 抵扣全系模型,日间限时1折,夜间折扣更大。
第三部分:Kimi K3 vs Qwen3.8 深度对比
一、参数规模对比
| 维度 | Kimi K3 | Qwen3.8-Max |
|---|---|---|
| 总参数量 | 2.8T | 2.4T |
| 架构 | MoE + KDA + AttnRes | MoE(细节未披露) |
| 专家数量 | 896 个 | 未披露 |
| 激活专家 | 16 个(<2%) | 未披露 |
| 上下文窗口 | 100万 token | 200K/400K/1M |
分析:K3 参数量更大(2.8T vs 2.4T),但 Qwen3.8 提供更灵活的上下文选择。
二、架构创新对比
| 维度 | Kimi K3 | Qwen3.8-Max |
|---|---|---|
| 注意力机制 | KDA 混合线性注意力(3:1布局) | 未披露 |
| 深度优化 | AttnRes 注意力残差 | 未披露 |
| 专家路由 | Stable LatentMoE + 分位数平衡 | 未披露 |
| 技术透明度 | 高(官方博客详解) | 低(技术报告待发布) |
分析:K3 在架构创新上披露更详细,KDA 和 AttnRes 是有明确技术贡献的创新。Qwen3.8 的技术细节尚不清晰,需要等待官方技术报告。
三、性能表现对比
| 榜单 | Kimi K3 | Qwen3.8-Max |
|---|---|---|
| Frontend Code Arena | 1679(全球第一) | 未披露 |
| SWE Marathon | 42.0(全球第一) | 未披露 |
| Artificial Analysis 智能指数 | 57 | 未披露 |
| 官方定位 | 全球第三(仅次于 Fable 5、GPT-5.6 Sol) | "对标 Fable 5"(内部评估) |
分析:K3 有明确的第三方榜单成绩,Qwen3.8 的性能数据尚未公开。从已披露信息看,K3 在编程能力上有明显优势。
四、生态定位对比
| 维度 | Kimi K3 | Qwen3.8-Max |
|---|---|---|
| 产品定位 | 编程 + 长文本 + Agent | 通用旗舰 + 企业办公 |
| 核心场景 | 代码生成、科研、知识工作 | 工程开发、文档分析、多语言 |
| 接入渠道 | Kimi.com、Kimi Work、Kimi Code、API | 百炼 Token Plan、Qoder、QoderWork |
| 开源策略 | 7月27日前完整开源 | 正式版后开源 |
| 定价模式 | 按量付费(缓存优化) | 订阅制(Token Plan) |
分析:
- K3 更偏向技术开发者,强调编程能力和开源生态
- Qwen3.8 更偏向企业用户,强调办公自动化和多场景覆盖
五、信息透明度对比
| 维度 | Kimi K3 | Qwen3.8-Max |
|---|---|---|
| 官方博客 | 详细技术解析 | 产品介绍为主 |
| 技术报告 | 即将发布(arxiv) | 未提及 |
| Benchmark | 完整榜单数据 | 部分内部数据 |
| 局限性说明 | 明确列出三点限制 | 未提及 |
分析:K3 在信息透明度上明显领先,官方坦承局限性,这种态度值得肯定。Qwen3.8 的技术细节尚不清晰,需要等待更多信息。
六、市场反应对比
| 维度 | Kimi K3 | Qwen3.8-Max |
|---|---|---|
| 上线反应 | 48小时暂停新用户订阅 | 限时1折优惠 |
| 媒体评价 | "马斯克点赞"、"A股涨停" | "对标 Fable 5" |
| 开发者反馈 | 编程能力获高度认可 | 待更多用户验证 |
第四部分:总结与展望
一、两大模型的核心差异
| 维度 | Kimi K3 | Qwen3.8-Max |
|---|---|---|
| 技术路线 | 架构创新(KDA + AttnRes) | 规模扩展(MoE) |
| 核心优势 | 编程能力、开源生态 | 企业场景、订阅模式 |
| 目标用户 | 技术开发者、研究者 | 企业用户、办公场景 |
| 信息透明 | 高(详细技术披露) | 低(待技术报告) |
二、对中国大模型行业的意义
- 参数军备竞赛升级:2T+ 成为新门槛,中国大模型进入"万亿参数俱乐部"
- 开源成为标配:两大模型都承诺开源,打破闭源垄断
- 差异化竞争:K3 主打编程,Qwen3.8 主打企业,避免同质化
- 技术透明度重要:K3 的详细披露赢得开发者信任,Qwen3.8 需要跟进
三、待解答的问题
- Qwen3.8 的技术细节:MoE 专家数量、注意力机制、训练方法等何时披露?
- 实际性能对比:在相同 Benchmark 下,两者表现如何?
- 开源质量:开源后的模型是否能复现官方性能?
- 生态建设:两者如何构建开发者生态?
四、选型建议
| 场景 | 推荐选择 |
|---|---|
| 编程开发、代码生成 | Kimi K3(Code Arena 全球第一) |
| 科研、长文本分析 | Kimi K3(100万上下文、科研案例丰富) |
| 企业办公自动化 | Qwen3.8-Max(QoderWork 生态) |
| 多语言创作 | Qwen3.8-Max(官方重点优化) |
| 成本敏感 | Qwen3.8-Max(Token Plan 订阅制) |
| 本地部署 | 两者都即将开源,待验证 |
参考来源: