HalfSugar avatar

HalfSugar

半甜不要腻 · 记录学习、算法与 AI 前沿

这里是 HalfSugar 的个人博客,分享大模型与多模态前沿论文解读、工程实践、算法题解, 偶尔也有小游戏和生活碎片。内容按主题归档,欢迎用标签或搜索自由探索。

最新精选

最近文章

展示 15 / 126
·技术
1 分钟0

视频理解领域深度调研:Benchmark 全景与头部模型格局(2024–2026.8)

视频理解领域深度调研:Benchmark 全景与头部模型格局(2024–2026.8) > 当 Video-MME 榜单顶尖模型逼近 90%,我们却在 2026 年的新基准上看到最强模型不足 50 分。视频理解的"应试教育"时代正在结束,真正的智能考验才刚刚开始。 一、为什么要重新审视

·大模型
1 分钟0

Qwen3.8-Flash-Next 深度解读:GDN+QSA、门控残差与 N-gram Embedding,通向 Qwen4 的架构预览

一、引子:一个提前放出的"Qwen4 架构预览版" 2026 年 8 月 26 日晚,阿里通义千问团队发布并开源了 Qwen3.8-Flash-Next——一个多模态 MoE 模型。它的定位很特别:它不是 Qwen4 本身,而是 Qwen4 所使用架构的早期预览<sup>1

·认知科学, 心理学
1 分钟0

双重加工理论:快思考与慢思考,以及它如何解释我们对 AI 的信任

为什么我们明明知道该仔细看合同条款,却还是会被"限时优惠"的红色倒计时催着下单?为什么一个措辞流畅、语气自信的 AI 回答,会让我们下意识觉得它更可信?这些现象背后,站着认知心理学中影响最深远的理论之一——双重加工理论(Dual-Process Theory)。 一、核心主张:大脑里

·国自然, 科研管理
1 分钟0

国自然申请到结项全流程解析(附外国学者研究基金 RFIS 申请要点)

> 每年三月,国家自然科学基金(NSFC)的集中接收都会牵动无数科研人员的神经。但很多人对它的认知停留在"写本子、交材料、等结果",对评审怎么打分、经费怎么管、结题怎么验收,尤其是面向外籍学者的外国学者研究基金项目(RFIS),往往一知半解。这篇文章把国自然从申请到结项的完整流程梳理清楚,并

·AI治理, 认知科学
1 分钟0

生成式人工智能算法透明度架构对公众信任的影响机制及治理策略研究——基于双重加工理论视角

一、引言:一个被"相关"遮蔽的"机制"问题 生成式人工智能(GAI)正在快速嵌入公共生活,但一个悖论挥之不去:使用率越高,信任度反而越低。IBM 对 12 个国家 20589 名消费者的调查显示,2023—2024 年企业级 AI 使用率从 52% 升至 69%,消费者信任度却从 6

·AI治理, 科技政策
1 分钟0

生成式人工智能算法透明度架构对公众信任的影响机制及治理策略研究

> 生成式人工智能正以前所未有的速度渗透到信息生产、决策辅助与日常交互中,但一个悖论也同步浮现:使用率在上升,信任度却在下滑。IBM 2026 年覆盖 12 个国家、20589 名受访者的调查显示,AI 使用率从 52% 升至 69%,而用户对 AI 生成内容的信任度却从 63% 降至 59

·多模态, 论文解读
1 分钟0

UMM论文解读07-后训练篇:从GRPO联合强化到自奖励闭环,统一模型如何自我进化

> 前六篇我们把 UMM 的架构演进讲透了:从 Transformer/VQGAN 的知识底座,到 Chameleon/Emu3/Show-o 的早期探索,再到 Janus-Pro/BAGEL/U1 的三种主流范式、VCoT 把视觉变成思维载体、以及向视频与世界模型的延伸。但架构只决定了模型"能做什

·多模态, 论文解读
1 分钟0

UMM论文解读01-基础奠基篇:从Transformer到VQGAN,七篇论文构建统一多模态的知识底座

> 本系列将 UMM(Unified Multimodal Model,理解与生成统一模型)学习路径中涉及的每一篇论文,逐一读取原文、提炼核心思想、标注关键贡献。第一篇聚焦 2017-2023 年间七篇奠基性工作,它们不是统一模型本身,却共同构成了今天所有统一模型的知识底座。 !UMM论文解读系

·多模态, 论文解读
1 分钟0

UMM论文解读03-主流模型篇:Janus-Pro、BAGEL、SenseNova U1的三种统一范式

> 如果说 2024 年夏天的四篇论文回答了"统一是否可行",那么 2025 至 2026 年的三篇代表作——DeepSeek Janus-Pro、字节 BAGEL、商汤 SenseNova U1——回答的是"统一能否匹敌甚至超越专用模型"。三条路线分别选择了解耦编码、MoT 双塔、去 VE/VAE

·多模态, 论文解读
1 分钟0

UMM论文解读04-VCoT篇:从Visual Sketchpad到CoT-VLA,视觉如何成为思维的载体

> Chain-of-Thought 让 LLM 能用文字"想一遍再答",但人类在解决空间、几何、导航等问题时,不只在脑中推理——我们会画辅助线、做标记、在纸上打草稿。Visual Chain-of-Thought(VCoT)研究的就是:能不能让多模态模型也用视觉信息做推理中间产物,而不仅限于文字?

·多模态, 论文解读
1 分钟0

UMM论文解读05-视频与世界模型篇:UniVideo双流统一、Emu3.5下一状态预测与Lance多任务协同

> 统一模型在图像领域验证成功后,自然向视频和世界模型延伸。快手可灵与滑铁卢大学的 UniVideo 用 MLLM+MMDiT 双流架构把统一理解/生成/编辑扩展到视频;智源的 Emu3.5 把"下一 token 预测"升维到"下一状态预测",用 790 年互联网视频训练出一个 34B 的原生多模态

·多模态, 论文解读
1 分钟0

UMM论文解读06-终章:从统一表征到AGI终局之战

> 前五篇我们逐一拆解了 UMM 的知识底座、早期探索、主流范式、视觉思维链,以及向视频与世界模型的延伸。终章不再解读某一篇论文,而是退到第一性原理,把"理解生成统一、全模态(Omni)、世界模型、具身智能"这四个高频词串成一条技术进化线,并追问:当通用能力栈成型之后,AGI 的终局之战究竟在哪里。

·AI
1 分钟0

大模型记忆算法深度综述:从KV Cache到持久化记忆,AI如何从"过目即忘"到"长期进化"

> 当 AI 连你上周说过的话都记不住时,再强的推理能力也只是一次性的聪明。记忆,正在成为大模型架构设计的第一性维度。 引言 2026年8月,清华大学联合新加坡国立大学、博世人工智能研究院发布综述论文《Memory for Large Language Models》,首次从模型底层架构与

·AI, 多模态, 学习路径
1 分钟0

理解与生成统一模型(UMM)学习路径:从拼接架构到原生统一,从入门到前沿探索

理解与生成统一(Unified Multimodal Model, UMM)是 2024-2026 年多模态 AI 领域最活跃的研究方向之一。从 Meta 的 Chameleon 到字节的 BAGEL、商汤的 SenseNova U1,技术迭代以月为单位。本文给出一条从基础到前沿的完整学习路径,涵盖