HalfSugar avatar

HalfSugar

半甜不要腻 · 记录学习、算法与 AI 前沿

这里是 HalfSugar 的个人博客,分享大模型与多模态前沿论文解读、工程实践、算法题解, 偶尔也有小游戏和生活碎片。内容按主题归档,欢迎用标签或搜索自由探索。

最新精选

最近文章

展示 15 / 180 篇
·技术, 多模态
1 分钟0

流式视频理解 VLM 精读①:主动交互——模型到底应该何时开口?

> 这是「流式视频理解 VLM 精读」系列第 1 篇。上一篇是领域地图,这篇扎进最核心也最微妙的问题:流式视频模型凭什么决定自己"该不该开口、什么时候开口"? 一个看似简单、实则很难的问题 人陪你看球赛,进球时会喊"进了!",但不会每分钟都喊。这份"何时说话"的直觉,对 VLM 而

·技术, 多模态
1 分钟0

流式视频理解 VLM 精读②:长时记忆——无限视频流怎么记住?

> 这是「流式视频理解 VLM 精读」系列第 2 篇。上一篇讲"何时开口",这篇讲"开口时还记得什么"——视频是无限流,但模型的注意力窗口和显存是有限的,怎么做到"几个小时后还记得之前发生的事"? 记忆问题的本质 看过几小时球赛,人记得"上半场有个越位没吹"。但 VLM 做不到直接

·技术, 多模态
1 分钟0

流式视频理解 VLM 精读③:实时推理——怎么才够快?

> 这是「流式视频理解 VLM 精读」系列第 3 篇。前两篇解决"要不要说、还记得吗",这篇解决一个更现实的问题:就算你又主动又记得住,如果不够快,体验直接归零。视频是实时的,模型响应也要接近实时。 实时推理的两大硬指标 流式视频模型的"快"不是玄学,业界普遍盯着两个数: 1.

·技术, 多模态
1 分钟0

流式视频理解 VLM 精读④:边看边想(Streaming + CoT)——模型看视频时能「想一想」吗?

> 这是「流式视频理解 VLM 精读」系列第 4 篇。前三篇分别讲了"开口、记忆、速度",这篇是一个既有"智能"又有"品味"的新方向:让模型一边看视频一边输出推理(Chain-of-Thought),并且学会把握"想多久才算够"。 为什么"边看边想"这么难? 单看"看视频后再推理"

·技术, 多模态
1 分钟0

流式视频理解 VLM 精读⑤:评测与数据——30+ 个 benchmark 看懂门道

> 这是「流式视频理解 VLM 精读」系列的收尾篇。前四篇讲了"开口、记忆、速度、思考"四项技术,但这一切的前提是——我们要能正确衡量"模型到底懂不懂流式视频"。这篇把本领域 30+ 个 benchmark 与训练数据集盘一遍,帮你看懂门道。 为什么要专门的"流式"评测? 普通视频

·技术调研
1 分钟0

AI 每日调研 · 2026年10月06日|上海AI Lab开源多模态模型、具身企业获数亿融资

今日速览 1. 上海AI Lab开源16B MoE统一多模态模型InternLumina-U2,支持华为昇腾落地 2. 自变量机器人完成数亿元Pre-A++轮融资,加速具身智能大模型训练与场景落地 3. 全球首台搭载全国产化电子架构的具身智能机器人正式亮相 4. 具身智能领域新增Agent自提

·技术调研
1 分钟0

AI 每日调研 · 2026年10月05日|Reflection AI发布5010亿参数开源Beam大模型、腾讯阿里多模态模型开源

今日速览 1. 英伟达投创企Reflection AI发布5010亿参数开源大模型Beam,性能逼近头部厂商旗舰 2. 腾讯开源80B参数混元生图3.0,为目前参数量最大的开源生图模型 3. 阿里开源通义万相Wan2.2-S2V,单图加音频即可生成电影级数字人视频 4. 自变量机器人完成数亿元

·技术调研
1 分钟0

AI 每日调研 · 2026年10月04日|谷歌Gemini 4 Argon发布、紫东太初5.0开源登榜

今日速览 1. 谷歌发布新一代旗舰大模型Gemini 4 Argon,优先向专业安全人员开放测试 2. 中科院紫东太初开源ZDTaichu5.0-9B多模态大模型,9项国际基准拿8项第一 3. 微软发布通用多模态基础模型BEiT-3,推动多模态预训练技术统一 4. 具身智能领域新增Agent自

·技术调研
1 分钟0

AI 每日调研 · 2026年10月03日|新松工业具身机器人亮相、MiniMax 3上半年将发布

今日速览 1. 新松发布松羿力量版具身智能机器人,负载15千克适配工业搬运分拣场景 2. MiniMax官宣3.0版大模型上半年发布,主打多模态全球顶级性能 3. 汽车座舱多模态交互成落地热点,融合语音、视觉、环境感知能力 4. 具身智能领域新增Agent自提升、技能复用方向arXiv研究成果

·技术调研
1 分钟0

AI 每日调研 · 2026年10月02日|OpenAI发布GPT-Live、阿里开源PS级图像编辑模型

今日速览 1. OpenAI发布GPT-Live语音交互模型,支持同步听与说,对话体验接近真人 2. 阿里开源Qwen-Image-Layered图像模型,可实现PS级图层理解与精准编辑 3. 新松发布松羿力量版具身智能机器人,负载15千克适配工业搬运分拣场景 4. 多模态arXiv新增《Ge

·技术
1 分钟0

OpenAI DevDay 2026 全记录:从常驻智能体 dots、GPT-6.1 Sol 到主动智能时代

2026年9月29日,OpenAI 举办了迄今为止规模最大的一届 DevDay,一口气放出超过 20 项更新,横跨 ChatGPT、Codex、模型体系以及人与 AI 协作的全新方式。与往年"模型参数竞赛"的主线不同,今年 OpenAI 把叙事重心从「更聪明的模型」转向「更主动的智能」:让 AI 不