大模型记忆算法深度综述:从KV Cache到持久化记忆,AI如何从"过目即忘"到"长期进化"
> 当 AI 连你上周说过的话都记不住时,再强的推理能力也只是一次性的聪明。记忆,正在成为大模型架构设计的第一性维度。 引言 2026年8月,清华大学联合新加坡国立大学、博世人工智能研究院发布综述论文《Memory for Large Language Models》,首次从模型底层架构与
> 当 AI 连你上周说过的话都记不住时,再强的推理能力也只是一次性的聪明。记忆,正在成为大模型架构设计的第一性维度。 引言 2026年8月,清华大学联合新加坡国立大学、博世人工智能研究院发布综述论文《Memory for Large Language Models》,首次从模型底层架构与
引言 2026年,中国AI应用市场进入规模化爆发阶段。截至4月,国内AI应用Web端月访问量突破9亿次(同比+72%),APP端月下载量达2.4亿次(同比+76%),日活用户同比暴涨223%,全国日均Token调用量超过140万亿次,两年增长超1000倍。 然而,流量狂欢正在退潮。豆包MA
Arena 榜单深度解析:众包盲测如何成为 AI 评测的黄金标准 > 当传统基准测试面临"刷榜"困境,Arena 用真实人类投票重新定义了 AI 能力评估。 一、为什么需要 Arena? 传统基准测试的困境 在大型语言模型(LLM)飞速发展的今天,传统自动化基准测试(如 M
大模型训练数据深度解析:预训练、SFT、RL 都需要什么数据 > 数据是 AI 的燃料,但不同阶段需要不同"标号"的燃料。 2026 年,大模型训练已经从"大力出奇迹"进入"精细调数据"阶段。GPT-4o、Kimi K3、Qwen3.8 等旗舰模型的训练数据规模达到 TB 级,但数据质量
2026年7月,中国大模型迎来"双雄对决": - 7月16日:月之暗面发布 Kimi K3,2.8万亿参数 - 7月19日:阿里通义发布 Qwen3.8-Max-Preview,2.4万亿参数 两个模型几乎同时发布,参数量都突破2万亿,都宣称对标 Claude F
全球AI算力格局深度解析:六大阵营与中美博弈 > 算力,是AI时代的石油。2026年,这场围绕算力的军备竞赛已进入白热化阶段。 --- 一、全球算力总览:万亿美元级的军备竞赛 2026年,全球AI算力市场呈现几个关键数据: | 指标 | 数值 | |------|------|
引言 一个耐人寻味的现象: 号称"自由开放"的美国,正在全面限制AI大模型,甚至随意封禁中国用户使用;而被封锁的中国AI,却坚持走开源路线,从通义千问到DeepSeek,从Qwen到Kimi,纷纷选择开源。 这是价值观的差异,还是战略的选择? 一、美国限制AI的逻辑 1
DeepSeek 技术报告发展脉络综述:从 V1 到 V4 的三年进阶之路 摘要:从 2023 年底到 2026 年,DeepSeek(深度求索)用三年时间完成了从无人问津到全球瞩目的蜕变。本文系统梳理 DeepSeek 发布的五份核心技术报告(V1、V2、V3、R1、V4),解读其技
可控制推理深度的方法:从训练到推理的完整技术解析 > 为什么有些问题需要"深思熟虑",有些问题只需"脱口而出"?大模型如何学会根据任务复杂度调整推理深度?本文从训练数据准备、损失函数设计、强化学习奖励,到推理阶段的动态循环、置信度评估、早停机制,完整解析可控推理深度的技术实现。 ---
DeepSeek DSpark 推测解码技术心得:以算法换算力的工程智慧 2026 年 6 月 27 日,DeepSeek 联合北京大学发布了 DSpark 推理加速框架。作为一名长期关注大模型推理优化的技术人员,我仔细阅读了论文和相关技术文档,深受启发。这篇文章记录我对 DSpark 技术原
论文解析 | SAO:单轨迹异步优化在智能体强化学习中的应用 论文标题:Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning 作者:Zhenyu Hou, Yujiang Li
> 论文:Video Generation Models are General-Purpose Vision Learners > arXiv:2607.09024 | 2026年7月10日 > 会议:ECCV 2026 > 项目主页:https://genception.github.io/ >
项目概览 | 维度 | SenseNova-U1 | SenseNova-Vision | |---|---|---| | 全称 | Unifying Multimodal Understanding and Generation | Vision as Unified Multimodal
> 论文:SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture > arXiv:2605.12500 | 2026年5月12日 > 项目主页:https://github.
> 论文:Vision as Unified Multimodal Generation > arXiv:2607.06560 | 2026年7月7日 > 项目主页:https://github.com/OpenSenseNova/SenseNova-Vision --- 一句话总结 S
> 对比论文: > - Vision Banana: Image Generators are Generalist Vision Learners arXiv: 2604.20329, 2026年4月 > - SenseNova-Vision: Vision as Unified Multim
多模态大模型发展综述(~2026.7) > 本文系统梳理多模态大模型从 2021 年至 2026 年的技术演进脉络,深入分析主流模型的技术架构、核心创新与发展关系。 --- 一、发展脉络总览 ``` 2021-2022 ──── CLIP / BLIP / BEiT-3