HalfSugar avatar

HalfSugar

半甜不要腻 · 记录学习、算法与 AI 前沿

这里是 HalfSugar 的个人博客,分享大模型与多模态前沿论文解读、工程实践、算法题解, 偶尔也有小游戏和生活碎片。内容按主题归档,欢迎用标签或搜索自由探索。

最新精选

最近文章

展示 15 / 152
·技术调研
1 分钟0

AI 每日调研 · 2026年09月19日|Qwen全模态模型发布、具身智能户外全自主直播

今日速览 1. 阿里发布Qwen3.8-Omni-Flash原生全模态模型,支持1M上下文,音视频理解能力大幅提升 2. 乐享科技完成全球首次具身智能机器人1小时户外全自主直播,覆盖点单、烧烤全流程 3. 移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统,为AI应用提供自主可控算力

·技术调研
1 分钟0

AI 每日调研 · 2026年09月18日|阿里发布Qwen3.8-Omni、移动云推国产异构推理系统

今日速览 1. 阿里巴巴推出新一代原生全模态模型Qwen3.8-Omni-Flash,支持文本、图像、音频、视频输入及1M上下文,音视频Agent成本下降九成。 2. 移动云联合多家机构发布国内首个国产GPU+类脑芯片大模型异构混合推理系统,为国产算力支撑大模型推理提供新路径。 3. 紫东太初

·技术调研
1 分钟0

AI 每日调研 · 2026年09月17日|OpenAI GPT-6将发、Qwen3.8全模态模型上线

今日速览 1. OpenAI 预告参数量超4万亿的GPT-6大模型1个月内发布,GPT-6 Astra已上线工作场景,大模型迭代带动算力产业链关注度提升。 2. 阿里千问发布Qwen3.8-Omni-Flash原生全模态模型,支持1M上下文,音视频输入成本最高下降98%,全模态能力较上一代提升

·技术
1 分钟0

2026外滩大会全记录:共创AI新经济——智能体商业、具身智能与AI新经济的三个切面

2026年9月9日至12日,以「共创AI新经济」为主题的2026 Inclusion·外滩大会在上海黄浦世博园区举行。这是外滩大会自2020年连续举办的第四届1。和往届聚焦金融科技技术前沿不同,本届大会最大的变化,是把聚光灯从「AI能升什么级」转向「AI能不能真的帮人办事、帮人交易、走进工厂和田

·技术
1 分钟0

什么是 Agent,Agent 又是怎么被评测的?——从定义、核心循环到 SWE-bench、GAIA、tau-bench 一张图讲清

"Agent"(智能体)大概是 2024 年以来被用得最滥、也最容易引起误解的一个词。挂个工具调用就叫 Agent,套层 while 循环也叫 Agent,加个规划模块还叫 Agent。与此同时,围绕 Agent 的评测也在两年内迅速膨胀:SWE-bench、GAIA、WebArena、OSWorl

·技术
1 分钟0

全双工语音模型精读①:Moshi——第一个实时全双工语音大模型,双流建模与 Inner Monologue

> 全双工语音模型系列精读第 1 篇。本文基于 Moshi 官方论文 arXiv:2410.00037v2 与开源代码,梳理其设计动机、架构与评测。配套总览见《全双工语音大模型全景调研》。 一、为什么它是"鼻祖" 在 Moshi 之前(2024 年 9 月之前),所有语音助手都是级联流

·技术
1 分钟0

全双工语音模型精读②:Freeze-Omni——冻结 LLM、8 张卡 6 万条数据做出全双工语音对话

> 全双工语音模型系列精读第 2 篇。本文基于 Freeze-Omni 论文 arXiv:2411.00774v5 与官方项目页,梳理其"冻结骨干"路线。配套总览见《全双工语音大模型全景调研》。 一、它要解决的痛点:语音数据太少,微调会"变傻" GPT-4o 展示端到端语音交互后,2024

·技术
1 分钟0

全双工语音模型精读③:GLM-4-Voice-9B——175bps 单码本、12.5Hz、INT4 可本地跑的中文语音助手

> 全双工语音模型系列精读第 3 篇。本文基于 GLM-4-Voice 技术报告 arXiv:2412.02612 与官方开源仓库,梳理其端侧中文实时语音方案。配套总览见《全双工语音大模型全景调研》。 一、定位:要"像人"、要实时、还要能本地跑 GLM-4-Voice(智谱 AI,Zeng

·技术
1 分钟0

全双工语音模型精读④:Qwen3-Omni——Thinker-Talker MoE,音频首包 234ms 的开源全模态旗舰

> 全双工语音模型系列精读第 4 篇。本文基于 Qwen3-Omni 技术报告 arXiv:2509.17765 与官方开源仓库,梳理其 Thinker-Talker MoE 架构。配套总览见《全双工语音大模型全景调研》;下一代 Qwen3.5-Omni 见该文第五节。 一、定位:首个"全模

·技术
1 分钟0

全双工语音模型精读⑤:Gander 论文精读——腾讯混元的全双工语音智能体,如何把"实时对话"和"长任务干活"缝进一个模型

> 全双工语音模型系列精读第 5 篇。本文逐节解读《Omni Interaction Agent Technical Report》(Gander,arXiv:2609.08977v2,2026 年 9 月 9 日)。该研究由腾讯混元语音团队(Hunyuan Speech Team, Tence

·技术
1 分钟0

全双工语音模型精读⑥:Qwen3.5-Omni Realtime——Hybrid-MoE、ARIA 文音对齐与语义打断的全模态旗舰

> 全双工语音模型系列精读第 6 篇。本文基于 Qwen 官方博客《Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI》(2026-03-30)与阿里云百炼 Realtime API 文档。配套总览见《全双工语音大模型全景调研》;上一代 Qw

·技术
1 分钟0

全双工语音模型精读⑦:OpenAI gpt-realtime 与 GPT-Live——从端到端 S2S API 到全双工前台/后台委派

> 全双工语音模型系列精读第 7 篇。本文基于 OpenAI 官方博客与官方帮助文档,梳理 OpenAI 语音线两代产品:gpt-realtime(2025-08-28 GA)与 GPT-Live(2026-07-08)。配套总览见《全双工语音大模型全景调研》。 一、OpenAI 语音线的两

·技术
1 分钟0

全双工语音模型精读⑧:Google Gemini Live API——原生多模态全双工、视觉在环与主动开口

> 全双工语音模型系列精读第 8 篇。本文基于 Google 官方 Gemini API 文档(Live API)梳理其原生多模态全双工方案。配套总览见《全双工语音大模型全景调研》。 一、定位:把"视觉在环"做成 Live API 标配 Gemini Live API 是 Google 面