全部标签

#论文精读

9 篇文章

·技术
1 分钟0

全双工语音模型精读①:Moshi——第一个实时全双工语音大模型,双流建模与 Inner Monologue

> 全双工语音模型系列精读第 1 篇。本文基于 Moshi 官方论文 arXiv:2410.00037v2 与开源代码,梳理其设计动机、架构与评测。配套总览见《全双工语音大模型全景调研》。 一、为什么它是"鼻祖" 在 Moshi 之前(2024 年 9 月之前),所有语音助手都是级联流

·技术
1 分钟0

全双工语音模型精读②:Freeze-Omni——冻结 LLM、8 张卡 6 万条数据做出全双工语音对话

> 全双工语音模型系列精读第 2 篇。本文基于 Freeze-Omni 论文 arXiv:2411.00774v5 与官方项目页,梳理其"冻结骨干"路线。配套总览见《全双工语音大模型全景调研》。 一、它要解决的痛点:语音数据太少,微调会"变傻" GPT-4o 展示端到端语音交互后,2024

·技术
1 分钟0

全双工语音模型精读③:GLM-4-Voice-9B——175bps 单码本、12.5Hz、INT4 可本地跑的中文语音助手

> 全双工语音模型系列精读第 3 篇。本文基于 GLM-4-Voice 技术报告 arXiv:2412.02612 与官方开源仓库,梳理其端侧中文实时语音方案。配套总览见《全双工语音大模型全景调研》。 一、定位:要"像人"、要实时、还要能本地跑 GLM-4-Voice(智谱 AI,Zeng

·技术
1 分钟0

全双工语音模型精读④:Qwen3-Omni——Thinker-Talker MoE,音频首包 234ms 的开源全模态旗舰

> 全双工语音模型系列精读第 4 篇。本文基于 Qwen3-Omni 技术报告 arXiv:2509.17765 与官方开源仓库,梳理其 Thinker-Talker MoE 架构。配套总览见《全双工语音大模型全景调研》;下一代 Qwen3.5-Omni 见该文第五节。 一、定位:首个"全模

·技术
1 分钟0

全双工语音模型精读⑤:Gander 论文精读——腾讯混元的全双工语音智能体,如何把"实时对话"和"长任务干活"缝进一个模型

> 全双工语音模型系列精读第 5 篇。本文逐节解读《Omni Interaction Agent Technical Report》(Gander,arXiv:2609.08977v2,2026 年 9 月 9 日)。该研究由腾讯混元语音团队(Hunyuan Speech Team, Tence

·技术
1 分钟0

全双工语音模型精读⑥:Qwen3.5-Omni Realtime——Hybrid-MoE、ARIA 文音对齐与语义打断的全模态旗舰

> 全双工语音模型系列精读第 6 篇。本文基于 Qwen 官方博客《Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI》(2026-03-30)与阿里云百炼 Realtime API 文档。配套总览见《全双工语音大模型全景调研》;上一代 Qw

·技术
1 分钟0

全双工语音模型精读⑦:OpenAI gpt-realtime 与 GPT-Live——从端到端 S2S API 到全双工前台/后台委派

> 全双工语音模型系列精读第 7 篇。本文基于 OpenAI 官方博客与官方帮助文档,梳理 OpenAI 语音线两代产品:gpt-realtime(2025-08-28 GA)与 GPT-Live(2026-07-08)。配套总览见《全双工语音大模型全景调研》。 一、OpenAI 语音线的两

·技术
1 分钟0

全双工语音模型精读⑧:Google Gemini Live API——原生多模态全双工、视觉在环与主动开口

> 全双工语音模型系列精读第 8 篇。本文基于 Google 官方 Gemini API 文档(Live API)梳理其原生多模态全双工方案。配套总览见《全双工语音大模型全景调研》。 一、定位:把"视觉在环"做成 Live API 标配 Gemini Live API 是 Google 面

·技术
1 分钟0

全双工语音模型精读⑨:字节 Seeduplex 与 SeedRealtime——RL 话轮决策到音视频原生全双工

> 全双工语音模型系列精读第 9 篇。本文基于字节 Seed 官方页面与火山引擎 API 文档,梳理字节语音全双工两步走:纯语音的 Seeduplex(2026.4)与音视频原生的 SeedRealtime(2026.8)。配套总览见《全双工语音大模型全景调研》。 一、字节的两步走 字节在