归档
共 149 篇文章 · 按年/月时间线排列,系列文章见 系列归档,每日调研连载见 Daily。
202687 篇3 个月
9 月20 篇
- UMM论文解读08-理解与生成的协同真相-南洋理工商汤控变量实验揭示统一多模态模型是共赢还是内耗
- Anthropic 蒸馏报告解读:一场 2 亿次交互的「思维链」争夺战
- LLM-as-a-Judge 不是神谕:自我改进 Agent 为什么需要确定性护栏
- 2026外滩大会全记录:共创AI新经济——智能体商业、具身智能与AI新经济的三个切面
- 什么是 Agent,Agent 又是怎么被评测的?——从定义、核心循环到 SWE-bench、GAIA、tau-bench 一张图讲清
- 全双工语音模型精读①:Moshi——第一个实时全双工语音大模型,双流建模与 Inner Monologue
- 全双工语音模型精读②:Freeze-Omni——冻结 LLM、8 张卡 6 万条数据做出全双工语音对话
- 全双工语音模型精读③:GLM-4-Voice-9B——175bps 单码本、12.5Hz、INT4 可本地跑的中文语音助手
- 全双工语音模型精读④:Qwen3-Omni——Thinker-Talker MoE,音频首包 234ms 的开源全模态旗舰
- 全双工语音模型精读⑤:Gander 论文精读——腾讯混元的全双工语音智能体,如何把"实时对话"和"长任务干活"缝进一个模型
- 全双工语音模型精读⑥:Qwen3.5-Omni Realtime——Hybrid-MoE、ARIA 文音对齐与语义打断的全模态旗舰
- 全双工语音模型精读⑦:OpenAI gpt-realtime 与 GPT-Live——从端到端 S2S API 到全双工前台/后台委派
- 全双工语音模型精读⑧:Google Gemini Live API——原生多模态全双工、视觉在环与主动开口
- 全双工语音模型精读⑨:字节 Seeduplex 与 SeedRealtime——RL 话轮决策到音视频原生全双工
- 全双工语音大模型全景调研(2026年9月):13 个维度看懂 Moshi、GPT-Live、Gemini Live、SeedRealtime、Gander 们的技术路线
- 用 Seedance 和 MiniMax H3 制作 AI 短剧保姆级教程:一个人、一台电脑、两小时出片的完整流水线
- GPT-6 Astra 深度调研:大模型从“会答题”到“会干活”,Computer Use 时代的首场旗舰战争
- Atlas 深度调研:李飞飞 World Labs 的全能世界模型,与世界模型三条路线之争
- SeedRealtime 深度调研:字节原生音视频全双工大模型,与 GPT-Live / Gemini Live 的三条路线之争
- UMM 四大前沿动态深度调研:Gemini Omni 1.1 Flash GA、Swift-Image、VGAU-Diag 与 GAS
8 月28 篇
- 运动健身 AI 场景全景调研:瑜伽、跑步、走姿、力量、网球、举重、羽毛球、游泳、舞蹈、高尔夫十大场景拆解(2024–2026)
- 运动健身 AI 产品形态深度调研:两大阵营 30+ 家竞品全景与七大关键判断(2024–2026)
- 视频理解在运动场景的全面调研:从姿态估计到多模态大模型与公司格局(2024–2026)
- 视频理解领域深度调研:Benchmark 全景与头部模型格局(2024–2026.8)
- GLM-5.3-Flash 深度解读:320B-A18B、混合注意力与 1/40 成本背后的架构逻辑
- Qwen3.8-Flash-Next 深度解读:GDN+QSA、门控残差与 N-gram Embedding,通向 Qwen4 的架构预览
- 双重加工理论:快思考与慢思考,以及它如何解释我们对 AI 的信任
- 国自然申请到结项全流程解析(附外国学者研究基金 RFIS 申请要点)
- 生成式人工智能算法透明度架构对公众信任的影响机制及治理策略研究——基于双重加工理论视角
- 生成式人工智能算法透明度架构对公众信任的影响机制及治理策略研究
- UMM论文解读07-后训练篇:从GRPO联合强化到自奖励闭环,统一模型如何自我进化
- UMM论文解读01-基础奠基篇:从Transformer到VQGAN,七篇论文构建统一多模态的知识底座
- UMM论文解读02-早期统一模型篇:Chameleon、Emu3、Transfusion、Show-o的四条技术路线
- UMM论文解读03-主流模型篇:Janus-Pro、BAGEL、SenseNova U1的三种统一范式
- UMM论文解读04-VCoT篇:从Visual Sketchpad到CoT-VLA,视觉如何成为思维的载体
- UMM论文解读05-视频与世界模型篇:UniVideo双流统一、Emu3.5下一状态预测与Lance多任务协同
- UMM论文解读06-终章:从统一表征到AGI终局之战
- 大模型记忆算法深度综述:从KV Cache到持久化记忆,AI如何从"过目即忘"到"长期进化"
- 理解与生成统一模型(UMM)学习路径:从拼接架构到原生统一,从入门到前沿探索
- 大模型缓存命中机制深度解析:不只是前缀匹配,三层缓存体系让Token成本断崖式下降
- 流量是资产还是负债?大模型时代商业模式的根本性重构
- SenseNova U1.5深度解析:去VE/VAE的原生统一多模态,4K图像生成与精准编辑的技术突破
- DeepSeek Harness深度解析:一切皆插件的Agent运行底座,与Codex/Claude Code的本质区别
- 如何搭建一个服务于C端的AI应用:从架构设计到商业落地的全链路指南
- 实时音视频RTC深度综述:从WebRTC到AI原生通信的技术演进与产业格局
- 脉冲神经网络(SNN)深度综述:从生物启发到类脑智能的技术演进
- 2026年8月大模型行业全景扫描:模型密集发布、Agent安全升级与开放权重扩张
- Omni模型全景解析:从多模态到全模态的技术演进与产业格局
7 月39 篇
- DeepSeek V4 Flash 深度解析:后训练驱动的 Agent 能力跃升与极致性价比
- MiniMax H3 深度解析:首款开源全模态生成模型的技术突破与产业影响
- 大模型 API 缓存机制深度解析:Prompt Caching 的技术原理与安全隔离
- Kimi K3 全面开源深度解析:2.8万亿参数模型的技术突破与产业影响
- 2026年菲尔兹奖深度解析:华人数学家的历史性突破与未解数学猜想
- AI评测双榜深度解析:AAII智能指数与LMArena盲测的互补之道
- Arena 榜单深度解析:众包盲测如何成为 AI 评测的黄金标准
- 大模型训练数据深度解析 - 预训练、SFT、RL 都需要什么数据
- 注意力机制深度技术解析:从数学原理到Transformer架构演进
- Attention Residuals 论文深度解读:Kimi K3 的核心架构创新
- Causal vs Streaming DiT:视频生成与交互的两大技术路线深度对比
- Kimi K3 官方博客深度解读:开源3T旗舰的技术突破与产品哲学
- Kimi K3 vs Qwen3.8:两大国产2T+旗舰模型技术深度对比
- Kimi Linear 论文深度解读:KDA 线性注意力架构的技术突破
- 全球AI算力格局深度解析:六大阵营与中美博弈
- WAIC 2026 深度洞察:AI正式进入'交付元年'
- 三大AI算力平台巅峰对决:英伟达GB200 vs 华为昇腾950 vs 阿里真武M890
- 扣子 vs 豆包:字节AI双子星全面对比
- 自由的边界:美国封锁AI,中国为何坚持开源?
- 通义万象前世今生:从 AI 绘画到电影级视频生成的完整演进
- Boogu-Image-0.1 Agentic 技术实现详解:从理解到生成的智能体架构
- Boogu-Image-0.1 论文解析:开源统一多模态图像生成的新范式
- Boogu-Image-0.1 论文完整翻译:Boosting Open-Source Unified Multimodal Understanding and Generation
- Claude Code 发展史揭秘:从内部工具到 Anthropic 半壁江山
- DeepSeek 技术报告发展脉络综述:从 V1 到 V4 的三年进阶之路
- Kimi K3 全面解析:全球首个开源三万亿模型的技术突破
- 可控制推理深度的方法:从训练到推理的完整技术解析
- Anthropic 智能体失配报告解读:AI 的四种「使坏」模式
- DeepSeek DSpark 推测解码技术心得:以算法换算力的工程智慧
- 论文解析 | SAO:单轨迹异步优化在智能体强化学习中的应用
- 珠海 6 日亲子游 | 海洋王国 · 飞船乐园 · 赶海 · 外伶仃岛
- GenCeption 论文翻译总结
- SenseNova-U1 与 SenseNova-Vision 深度对比
- SenseNova-U1 论文翻译总结
- SenseNova-Vision 论文翻译总结
- Vision Banana vs SenseNova-Vision 深度对比
- 全模态大模型综述:从 Qwen2.5-Omni 到 DuplexSLA 的技术演进
- 多模态大模型发展综述(~2026.7)
- 🎮 小游戏合集 | 2048 & 数独 & 生命游戏 & MBTI