流式视频理解 VLM 精读:领域地图——从全双工语音到'边看边想边开口'
> 本文是「流式视频理解 VLM 精读」系列的开篇(总览/索引篇)。系列素材来自开源文献地图 Awesome-VLM-Streaming-Videohttps://github.com/ydyhello/Awesome-VLM-Streaming-Video(京东探索研究院维护),它汇集了
半甜不要腻 · 记录学习、算法与 AI 前沿
这里是 HalfSugar 的个人博客,分享大模型与多模态前沿论文解读、工程实践、算法题解, 偶尔也有小游戏和生活碎片。内容按主题归档,欢迎用标签或搜索自由探索。
> 本文是「流式视频理解 VLM 精读」系列的开篇(总览/索引篇)。系列素材来自开源文献地图 Awesome-VLM-Streaming-Videohttps://github.com/ydyhello/Awesome-VLM-Streaming-Video(京东探索研究院维护),它汇集了
> 这是「流式视频理解 VLM 精读」系列第 1 篇。上一篇是领域地图,这篇扎进最核心也最微妙的问题:流式视频模型凭什么决定自己"该不该开口、什么时候开口"? 一个看似简单、实则很难的问题 人陪你看球赛,进球时会喊"进了!",但不会每分钟都喊。这份"何时说话"的直觉,对 VLM 而
> 这是「流式视频理解 VLM 精读」系列第 2 篇。上一篇讲"何时开口",这篇讲"开口时还记得什么"——视频是无限流,但模型的注意力窗口和显存是有限的,怎么做到"几个小时后还记得之前发生的事"? 记忆问题的本质 看过几小时球赛,人记得"上半场有个越位没吹"。但 VLM 做不到直接
> 这是「流式视频理解 VLM 精读」系列第 3 篇。前两篇解决"要不要说、还记得吗",这篇解决一个更现实的问题:就算你又主动又记得住,如果不够快,体验直接归零。视频是实时的,模型响应也要接近实时。 实时推理的两大硬指标 流式视频模型的"快"不是玄学,业界普遍盯着两个数: 1.
> 这是「流式视频理解 VLM 精读」系列第 4 篇。前三篇分别讲了"开口、记忆、速度",这篇是一个既有"智能"又有"品味"的新方向:让模型一边看视频一边输出推理(Chain-of-Thought),并且学会把握"想多久才算够"。 为什么"边看边想"这么难? 单看"看视频后再推理"
> 这是「流式视频理解 VLM 精读」系列的收尾篇。前四篇讲了"开口、记忆、速度、思考"四项技术,但这一切的前提是——我们要能正确衡量"模型到底懂不懂流式视频"。这篇把本领域 30+ 个 benchmark 与训练数据集盘一遍,帮你看懂门道。 为什么要专门的"流式"评测? 普通视频
--- 今日速览 1. OpenAI官宣GPT-6全量上线,覆盖全球超12亿ChatGPT用户,新增智能UI交互能力 2. Anthropic发布Claude Haiku 5.5,运行成本较前代降75%,10万Token内请求API价格降90% 3. 谷歌开源EmbeddingGemma 2原
今日速览 1. 上海AI Lab开源16B MoE统一多模态模型InternLumina-U2,支持华为昇腾落地 2. 自变量机器人完成数亿元Pre-A++轮融资,加速具身智能大模型训练与场景落地 3. 全球首台搭载全国产化电子架构的具身智能机器人正式亮相 4. 具身智能领域新增Agent自提
今日速览 1. 英伟达投创企Reflection AI发布5010亿参数开源大模型Beam,性能逼近头部厂商旗舰 2. 腾讯开源80B参数混元生图3.0,为目前参数量最大的开源生图模型 3. 阿里开源通义万相Wan2.2-S2V,单图加音频即可生成电影级数字人视频 4. 自变量机器人完成数亿元
今日速览 1. 谷歌发布新一代旗舰大模型Gemini 4 Argon,优先向专业安全人员开放测试 2. 中科院紫东太初开源ZDTaichu5.0-9B多模态大模型,9项国际基准拿8项第一 3. 微软发布通用多模态基础模型BEiT-3,推动多模态预训练技术统一 4. 具身智能领域新增Agent自
今日速览 1. 新松发布松羿力量版具身智能机器人,负载15千克适配工业搬运分拣场景 2. MiniMax官宣3.0版大模型上半年发布,主打多模态全球顶级性能 3. 汽车座舱多模态交互成落地热点,融合语音、视觉、环境感知能力 4. 具身智能领域新增Agent自提升、技能复用方向arXiv研究成果
今日速览 1. OpenAI发布GPT-Live语音交互模型,支持同步听与说,对话体验接近真人 2. 阿里开源Qwen-Image-Layered图像模型,可实现PS级图层理解与精准编辑 3. 新松发布松羿力量版具身智能机器人,负载15千克适配工业搬运分拣场景 4. 多模态arXiv新增《Ge
--- 今日速览 1. 国内首个通用具身智能训练平台正式对外开放,支持多形态智能体"看学做"一站式训练 2. Cohere Embed 5嵌入模型正式上线,官方已发布完整技术细节与可用性说明 3. 多模态领域arxiv新增《Gestalt: Large Multimodal Interplay
今日速览 1. Cohere 于9月30日正式推出Embed 5嵌入模型,相关技术细节已更新至官方Release Notes 2. 中国互联网络信息中心发布报告,截至2026年上半年我国生成式AI用户规模突破7亿,普及率超50% 3. 多模态领域arXiv新增《Gestalt: Large M
2026年9月29日,OpenAI 举办了迄今为止规模最大的一届 DevDay,一口气放出超过 20 项更新,横跨 ChatGPT、Codex、模型体系以及人与 AI 协作的全新方式。与往年"模型参数竞赛"的主线不同,今年 OpenAI 把叙事重心从「更聪明的模型」转向「更主动的智能」:让 AI 不