·大模型
1 分钟0
GLM-5.3-Flash 深度解读:320B-A18B、混合注意力与 1/40 成本背后的架构逻辑
一、引子:一个把海外社区搞糊涂的"牛来模型" 2026 年 8 月 20 日,一个名为 Ox Alpha 的匿名模型悄然上线全球模型聚合平台 OpenRouter 和编程平台 OpenCode。首日它就登顶 OpenRouter 调用量榜单、刷新单日 tokens 用量历史纪录,并终
一、引子:一个把海外社区搞糊涂的"牛来模型" 2026 年 8 月 20 日,一个名为 Ox Alpha 的匿名模型悄然上线全球模型聚合平台 OpenRouter 和编程平台 OpenCode。首日它就登顶 OpenRouter 调用量榜单、刷新单日 tokens 用量历史纪录,并终
一、引子:一个提前放出的"Qwen4 架构预览版" 2026 年 8 月 26 日晚,阿里通义千问团队发布并开源了 Qwen3.8-Flash-Next——一个多模态 MoE 模型。它的定位很特别:它不是 Qwen4 本身,而是 Qwen4 所使用架构的早期预览<sup>1
引言 如果你看过自己团队的大模型 Token 消耗看板,多半会注意到一个现象:主力模型的缓存命中率常年挂在 90% 上下,而且越是高频使用、跑得越久的模型,命中率越稳。 这不是某一家的"黑科技"。从 OpenAI、Anthropic 到 DeepSeek、Google,所有主流大模型 AP
Kimi K3 全面解析:全球首个开源三万亿模型的技术突破 2026年7月17日凌晨,月之暗面(Moonshot AI)正式发布了其迄今能力最强的模型——Kimi K3。这是全球首个达到三万亿参数级别的开源模型,标志着中国AI在大模型规模上再次刷新纪录。 核心参数一览 | 指