HalfSugar avatar

HalfSugar

半甜不要腻 · 记录学习、算法与 AI 前沿

这里是 HalfSugar 的个人博客,分享大模型与多模态前沿论文解读、工程实践、算法题解, 偶尔也有小游戏和生活碎片。内容按主题归档,欢迎用标签或搜索自由探索。

最新精选

最近文章

展示 15 / 129
·技术
1 分钟0

运动健身 AI 场景全景调研:瑜伽、跑步、走姿、力量、网球、举重、羽毛球、游泳、舞蹈、高尔夫十大场景拆解(2024–2026)

运动健身 AI 场景全景调研:十大运动场景拆解(2024–2026) > 上一篇调研报告按"厂商"组织,这一篇按"场景"组织。同一个算法(MediaPipe 33 点)在瑜伽里要判断"髋部是否摆正",在跑步里要判断"触地时间",在网球里要判断"挥拍轨迹"——指标、机位、反馈时机、付费方完全不同

·技术
1 分钟0

运动健身 AI 产品形态深度调研:两大阵营 30+ 家竞品全景与七大关键判断(2024–2026)

运动健身 AI 产品形态深度调研:两大阵营 30+ 家竞品全景与七大关键判断(2024–2026) > 上一篇文章梳理了运动视频理解的技术栈——从 MediaPipe/RTMPose 的 2D 关键点到 Twelve Labs/Keye-VL 的多模态大模型。这一篇把视角从"算法"拉到"产品"

·技术
1 分钟0

视频理解在运动场景的全面调研:从姿态估计到多模态大模型与公司格局(2024–2026)

视频理解在运动场景的全面调研:从姿态估计到多模态大模型与公司格局(2024–2026) > 当健身镜号称"99% 动作识别率",最新的 Fit3D 基准却显示最好模型在极端健身姿态下仍有 60mm 误差;当 FIFA 用 500Hz 球内芯片加 12 台追踪摄像头把越位判罚压到 25 秒,运动

·技术
1 分钟0

视频理解领域深度调研:Benchmark 全景与头部模型格局(2024–2026.8)

视频理解领域深度调研:Benchmark 全景与头部模型格局(2024–2026.8) > 当 Video-MME 榜单顶尖模型逼近 90%,我们却在 2026 年的新基准上看到最强模型不足 50 分。视频理解的"应试教育"时代正在结束,真正的智能考验才刚刚开始。 一、为什么要重新审视

·大模型
1 分钟0

Qwen3.8-Flash-Next 深度解读:GDN+QSA、门控残差与 N-gram Embedding,通向 Qwen4 的架构预览

一、引子:一个提前放出的"Qwen4 架构预览版" 2026 年 8 月 26 日晚,阿里通义千问团队发布并开源了 Qwen3.8-Flash-Next——一个多模态 MoE 模型。它的定位很特别:它不是 Qwen4 本身,而是 Qwen4 所使用架构的早期预览<sup>1

·认知科学, 心理学
1 分钟0

双重加工理论:快思考与慢思考,以及它如何解释我们对 AI 的信任

为什么我们明明知道该仔细看合同条款,却还是会被"限时优惠"的红色倒计时催着下单?为什么一个措辞流畅、语气自信的 AI 回答,会让我们下意识觉得它更可信?这些现象背后,站着认知心理学中影响最深远的理论之一——双重加工理论(Dual-Process Theory)。 一、核心主张:大脑里

·国自然, 科研管理
1 分钟0

国自然申请到结项全流程解析(附外国学者研究基金 RFIS 申请要点)

> 每年三月,国家自然科学基金(NSFC)的集中接收都会牵动无数科研人员的神经。但很多人对它的认知停留在"写本子、交材料、等结果",对评审怎么打分、经费怎么管、结题怎么验收,尤其是面向外籍学者的外国学者研究基金项目(RFIS),往往一知半解。这篇文章把国自然从申请到结项的完整流程梳理清楚,并

·AI治理, 认知科学
1 分钟0

生成式人工智能算法透明度架构对公众信任的影响机制及治理策略研究——基于双重加工理论视角

一、引言:一个被"相关"遮蔽的"机制"问题 生成式人工智能(GAI)正在快速嵌入公共生活,但一个悖论挥之不去:使用率越高,信任度反而越低。IBM 对 12 个国家 20589 名消费者的调查显示,2023—2024 年企业级 AI 使用率从 52% 升至 69%,消费者信任度却从 6

·AI治理, 科技政策
1 分钟0

生成式人工智能算法透明度架构对公众信任的影响机制及治理策略研究

> 生成式人工智能正以前所未有的速度渗透到信息生产、决策辅助与日常交互中,但一个悖论也同步浮现:使用率在上升,信任度却在下滑。IBM 2026 年覆盖 12 个国家、20589 名受访者的调查显示,AI 使用率从 52% 升至 69%,而用户对 AI 生成内容的信任度却从 63% 降至 59

·多模态, 论文解读
1 分钟0

UMM论文解读07-后训练篇:从GRPO联合强化到自奖励闭环,统一模型如何自我进化

> 前六篇我们把 UMM 的架构演进讲透了:从 Transformer/VQGAN 的知识底座,到 Chameleon/Emu3/Show-o 的早期探索,再到 Janus-Pro/BAGEL/U1 的三种主流范式、VCoT 把视觉变成思维载体、以及向视频与世界模型的延伸。但架构只决定了模型"能做什

·多模态, 论文解读
1 分钟0

UMM论文解读01-基础奠基篇:从Transformer到VQGAN,七篇论文构建统一多模态的知识底座

> 本系列将 UMM(Unified Multimodal Model,理解与生成统一模型)学习路径中涉及的每一篇论文,逐一读取原文、提炼核心思想、标注关键贡献。第一篇聚焦 2017-2023 年间七篇奠基性工作,它们不是统一模型本身,却共同构成了今天所有统一模型的知识底座。 !UMM论文解读系

·多模态, 论文解读
1 分钟0

UMM论文解读03-主流模型篇:Janus-Pro、BAGEL、SenseNova U1的三种统一范式

> 如果说 2024 年夏天的四篇论文回答了"统一是否可行",那么 2025 至 2026 年的三篇代表作——DeepSeek Janus-Pro、字节 BAGEL、商汤 SenseNova U1——回答的是"统一能否匹敌甚至超越专用模型"。三条路线分别选择了解耦编码、MoT 双塔、去 VE/VAE

·多模态, 论文解读
1 分钟0

UMM论文解读04-VCoT篇:从Visual Sketchpad到CoT-VLA,视觉如何成为思维的载体

> Chain-of-Thought 让 LLM 能用文字"想一遍再答",但人类在解决空间、几何、导航等问题时,不只在脑中推理——我们会画辅助线、做标记、在纸上打草稿。Visual Chain-of-Thought(VCoT)研究的就是:能不能让多模态模型也用视觉信息做推理中间产物,而不仅限于文字?

·多模态, 论文解读
1 分钟0

UMM论文解读05-视频与世界模型篇:UniVideo双流统一、Emu3.5下一状态预测与Lance多任务协同

> 统一模型在图像领域验证成功后,自然向视频和世界模型延伸。快手可灵与滑铁卢大学的 UniVideo 用 MLLM+MMDiT 双流架构把统一理解/生成/编辑扩展到视频;智源的 Emu3.5 把"下一 token 预测"升维到"下一状态预测",用 790 年互联网视频训练出一个 34B 的原生多模态