AI 每日调研 · 2026年09月19日|Qwen全模态模型发布、具身智能户外全自主直播
今日速览 1. 阿里发布Qwen3.8-Omni-Flash原生全模态模型,支持1M上下文,音视频理解能力大幅提升 2. 乐享科技完成全球首次具身智能机器人1小时户外全自主直播,覆盖点单、烧烤全流程 3. 移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统,为AI应用提供自主可控算力
半甜不要腻 · 记录学习、算法与 AI 前沿
这里是 HalfSugar 的个人博客,分享大模型与多模态前沿论文解读、工程实践、算法题解, 偶尔也有小游戏和生活碎片。内容按主题归档,欢迎用标签或搜索自由探索。
今日速览 1. 阿里发布Qwen3.8-Omni-Flash原生全模态模型,支持1M上下文,音视频理解能力大幅提升 2. 乐享科技完成全球首次具身智能机器人1小时户外全自主直播,覆盖点单、烧烤全流程 3. 移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统,为AI应用提供自主可控算力
今日速览 1. 阿里巴巴推出新一代原生全模态模型Qwen3.8-Omni-Flash,支持文本、图像、音频、视频输入及1M上下文,音视频Agent成本下降九成。 2. 移动云联合多家机构发布国内首个国产GPU+类脑芯片大模型异构混合推理系统,为国产算力支撑大模型推理提供新路径。 3. 紫东太初
今日速览 1. OpenAI 预告参数量超4万亿的GPT-6大模型1个月内发布,GPT-6 Astra已上线工作场景,大模型迭代带动算力产业链关注度提升。 2. 阿里千问发布Qwen3.8-Omni-Flash原生全模态模型,支持1M上下文,音视频输入成本最高下降98%,全模态能力较上一代提升
AI 每日调研 · 2026年09月16日 今日速览 1. 大模型领域头部厂商密集迭代:OpenAI 9月已推出GPT-Live-1、GPT-6 Astra,o1系列推理模型与200美元/月的ChatGPT Pro套餐同步公布;生数科技发布Vidu S2实时互动与视频编辑双模型,全量开放
> 论文:LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails > 作者:Vansh Wahi(滑铁卢大学,AI Research Engineer) > arXiv:
2026年9月9日至12日,以「共创AI新经济」为主题的2026 Inclusion·外滩大会在上海黄浦世博园区举行。这是外滩大会自2020年连续举办的第四届1。和往届聚焦金融科技技术前沿不同,本届大会最大的变化,是把聚光灯从「AI能升什么级」转向「AI能不能真的帮人办事、帮人交易、走进工厂和田
"Agent"(智能体)大概是 2024 年以来被用得最滥、也最容易引起误解的一个词。挂个工具调用就叫 Agent,套层 while 循环也叫 Agent,加个规划模块还叫 Agent。与此同时,围绕 Agent 的评测也在两年内迅速膨胀:SWE-bench、GAIA、WebArena、OSWorl
> 全双工语音模型系列精读第 1 篇。本文基于 Moshi 官方论文 arXiv:2410.00037v2 与开源代码,梳理其设计动机、架构与评测。配套总览见《全双工语音大模型全景调研》。 一、为什么它是"鼻祖" 在 Moshi 之前(2024 年 9 月之前),所有语音助手都是级联流
> 全双工语音模型系列精读第 2 篇。本文基于 Freeze-Omni 论文 arXiv:2411.00774v5 与官方项目页,梳理其"冻结骨干"路线。配套总览见《全双工语音大模型全景调研》。 一、它要解决的痛点:语音数据太少,微调会"变傻" GPT-4o 展示端到端语音交互后,2024
> 全双工语音模型系列精读第 3 篇。本文基于 GLM-4-Voice 技术报告 arXiv:2412.02612 与官方开源仓库,梳理其端侧中文实时语音方案。配套总览见《全双工语音大模型全景调研》。 一、定位:要"像人"、要实时、还要能本地跑 GLM-4-Voice(智谱 AI,Zeng
> 全双工语音模型系列精读第 4 篇。本文基于 Qwen3-Omni 技术报告 arXiv:2509.17765 与官方开源仓库,梳理其 Thinker-Talker MoE 架构。配套总览见《全双工语音大模型全景调研》;下一代 Qwen3.5-Omni 见该文第五节。 一、定位:首个"全模
> 全双工语音模型系列精读第 5 篇。本文逐节解读《Omni Interaction Agent Technical Report》(Gander,arXiv:2609.08977v2,2026 年 9 月 9 日)。该研究由腾讯混元语音团队(Hunyuan Speech Team, Tence
> 全双工语音模型系列精读第 6 篇。本文基于 Qwen 官方博客《Qwen3.5-Omni: Scaling Up, Toward Native Omni-Modal AGI》(2026-03-30)与阿里云百炼 Realtime API 文档。配套总览见《全双工语音大模型全景调研》;上一代 Qw
> 全双工语音模型系列精读第 7 篇。本文基于 OpenAI 官方博客与官方帮助文档,梳理 OpenAI 语音线两代产品:gpt-realtime(2025-08-28 GA)与 GPT-Live(2026-07-08)。配套总览见《全双工语音大模型全景调研》。 一、OpenAI 语音线的两
> 全双工语音模型系列精读第 8 篇。本文基于 Google 官方 Gemini API 文档(Live API)梳理其原生多模态全双工方案。配套总览见《全双工语音大模型全景调研》。 一、定位:把"视觉在环"做成 Live API 标配 Gemini Live API 是 Google 面