全部标签

#大语言模型

4 篇文章

·大模型
1 分钟0

GLM-5.3-Flash 深度解读:320B-A18B、混合注意力与 1/40 成本背后的架构逻辑

一、引子:一个把海外社区搞糊涂的"牛来模型" 2026 年 8 月 20 日,一个名为 Ox Alpha 的匿名模型悄然上线全球模型聚合平台 OpenRouter 和编程平台 OpenCode。首日它就登顶 OpenRouter 调用量榜单、刷新单日 tokens 用量历史纪录,并终

·大模型
1 分钟0

Qwen3.8-Flash-Next 深度解读:GDN+QSA、门控残差与 N-gram Embedding,通向 Qwen4 的架构预览

一、引子:一个提前放出的"Qwen4 架构预览版" 2026 年 8 月 26 日晚,阿里通义千问团队发布并开源了 Qwen3.8-Flash-Next——一个多模态 MoE 模型。它的定位很特别:它不是 Qwen4 本身,而是 Qwen4 所使用架构的早期预览<sup>1

·技术
1 分钟0

大模型缓存命中机制深度解析:不只是前缀匹配,三层缓存体系让Token成本断崖式下降

引言 如果你看过自己团队的大模型 Token 消耗看板,多半会注意到一个现象:主力模型的缓存命中率常年挂在 90% 上下,而且越是高频使用、跑得越久的模型,命中率越稳。 这不是某一家的"黑科技"。从 OpenAI、Anthropic 到 DeepSeek、Google,所有主流大模型 AP

·AI, 大模型
1 分钟0

Kimi K3 全面解析:全球首个开源三万亿模型的技术突破

Kimi K3 全面解析:全球首个开源三万亿模型的技术突破 2026年7月17日凌晨,月之暗面(Moonshot AI)正式发布了其迄今能力最强的模型——Kimi K3。这是全球首个达到三万亿参数级别的开源模型,标志着中国AI在大模型规模上再次刷新纪录。 核心参数一览 | 指