今日速览
- 小米发布并开源全模态大模型MiMo-V2.6系列,包含Pro与Flash两款,在第一梯队模型中兼顾性能、速度与成本,Pro版本登顶全球开源模型第一。
- 智谱GLM-5.3-FlashX正式上线,大模型阵营迭代持续加速。
- 高德发布空间智能AI平台,以空间智能技术推动智慧城市自主进化。
- 斑马智能推出端侧全模态模型AutoOmni2.0,任务处理能力堪比10倍参数量云模型。
- 全球首台搭载全国产化电子架构的具身智能机器人亮相,实现从AI决策到物理执行的全链路国产化。
大模型
厂商动态
- 小米发布并开源新一代MiMo-V2.6系列大模型 [北京市科委、中关村管委会]:该系列包含MiMo-V2.6-Pro与MiMo-V2.6-Flash两款,均支持全模态输入,在全球第一梯队模型中实现性能、速度和价格的较好平衡,其中Pro版本以46分的AA综合智能指数登顶全球开源模型第一,API定价沿用V2.5系列标准,单任务成本低至0.13美元,大幅降低顶尖AI使用门槛。
- 智谱GLM-5.3-FlashX上线 [国家科技基础条件平台中心]:作为智谱新一代轻量化大模型,主打高吞吐、低延迟推理,适配高频轻量业务场景。
- OpenAI推出GPT-6 Sol和Luna两款模型 [OpenAI官方]:两款模型以不同能力与成本组合,将前沿智能带入日常工作场景;同时上线MentalHealthBench基准,用于评估AI在真实心理健康对话中的回应实用性与安全性。
- Anthropic发布Sonnet 5.5模型 [21世纪经济报道]:运行速度显著快于Sonnet 5,是Opus 5.5的低成本替代与互补方案,定价为每百万输入token 2美元。
- Meta推出Muse Spark 1.1模型 [Meta AI官方]:开放Meta Model API公开预览,开发者可调用该模型,目前已在Meta AI app和meta.ai上线“Thinking”模式。
- 万联证券报告指出模型降本与安全治理同步演进 [新浪财经]:行业当前呈现性能提升、推理成本下降与安全治理体系完善并行的发展特征。
arXiv论文
- Differentiable Fuzzy Inference Layer: A Monotone, Compositional Ordinal Reasoning Head for Large Language Models:提出可微分模糊推理层,为大模型提供具备单调性、组合性的序数推理能力,优化逻辑推理场景表现。
- DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale:DeepSeek提出规模化智能体训练沙箱基础设施,解决智能体训练过程中的资源调度、环境隔离问题,提升训练效率。
- StarWM: Self-Supervised Trained Attention Routing for Robust World Models:提出自监督训练的注意力路由机制,构建更鲁棒的世界模型,提升大模型对未知环境的泛化能力。
AI 应用
厂商动态
- 高德发布空间智能AI平台 [新华网]:该平台以高德空间智能为基座,构建从空间还原到行业分析再到现实行动的完整链路,可支撑智慧城市、交通治理、商业选址等多场景需求,推动城市治理从被动响应向主动进化升级。
- Meta个人AI助手Muse商业化加速 [中信建投研报]:Muse支持邮件处理、旅行预订、交易执行等功能,上线12天下载量达280万次,正推进与Shopify支付生态整合,成为消费级智能体商业化的标杆案例。
- Manus海外发布2.0版本及个人智能助理Cue [新黄河]:同时宣布正组建团队开发面向国内市场的产品,与国产模型厂商及生态伙伴的合作稳步推进,国内产品信息暂未披露。
- OpenAI推出ChatGPT Work企业方案 [OpenAI官方]:具备企业级管控与治理能力,支持自动执行后台任务、适配常用工具与插件,可覆盖文档制作、数据处理、财务分析等企业级场景。
- Google DeepMind发布私有AI计算技术更新 [Google DeepMind官方]:推出基于安全服务器端内存的私有AI计算方案,在保障数据隐私的前提下提升模型推理效率,适配企业敏感数据场景。
arXiv论文
- SkillEvoReg: Regularizing Agent Skill Evolution:提出智能体技能演化正则化方法,提升智能体在复杂任务中的技能稳定性与泛化能力。
- Cross-Country Code-Mixing for Generative Recommendation:针对跨国推荐场景,提出跨语言代码混合生成式推荐方法,提升多语言环境下的推荐准确率。
多模态
厂商动态
- 小米MiMo-V2.6系列原生支持全模态输入 [鲸智社区]:MiMo-V2.6-Flash-RL采用稀疏MoE架构,总参数量309B,单Token激活参数量约15B,支持100万Token上下文,具备3D空间推理能力,可支撑智能体交互、空间理解等场景需求,性能超越Kimi K3、GLM-5.3。
- 国内多模态AIGC转向全链路系统能力竞争 [新华网]:行业已告别单纯比拼画质、时长的阶段,AI视频从生成素材向完整作品交付演进,全模态技术成为产业落地核心驱动力。
- 多模态交互重塑智能座舱体验 [新浪新闻]:2026年AI语音助手已融合视觉、手势、情绪感知等多模态信息,可通过面部表情、眼球轨迹、语音语调分析用户意图,在检测到驾驶员疲劳时主动调整座舱策略,主动服务能力大幅提升。
arXiv论文
- TAC-Time: Texts as Channels For Multimodal Time Series Forecasting:提出将文本作为模态传输通道的多模态时间序列预测方法,提升时序预测任务的准确性。
- Multimodal Thinking with Renderable Programs:提出可渲染程序的多模态思考框架,让多模态模型具备基于视觉、文本信息生成可执行程序的能力,支撑复杂推理任务。
- THERE AND BACK AGAIN: BIDIRECTIONAL DIFFUSION BRIDGES FOR MULTIMODALITY TRANSLATION:提出双向扩散桥架构,实现不同模态之间的双向高效转换,优化跨模态生成效果。
Omni 全模态
厂商动态
- 阿里发布Qwen3.8-Omni-Flash全模态模型 [钛媒体]:可同时处理文本、图像、音频、视频输入,支持1M上下文,相比上一代Qwen3.5-Omni-Plus在30项评测中平均得分提升超26%,音视频理解与生成能力显著增强,API成本最高降幅达98%,主打真实生产力场景的Agent能力,支持任务规划、工具调用、多模态创作。
- 斑马智能发布端侧全模态模型AutoOmni2.0-23B-A3B [新华网]:普通任务处理能力堪比10倍参数量云模型,复杂任务处理能力达到10倍参数量云模型的80%-90%,适配车载、IoT等端侧低功耗场景。
- Google DeepMind推出Gemini Omni模型 [Google DeepMind官方]:主打视频生成与编辑能力,支持多模态输入输出,可实现“任意模态输入生成任意模态内容”。
arXiv论文
- Qwen3.8-Omni: Towards Native Omni-Modal Agents:阿里千问团队发布Qwen3.8-Omni技术报告,详细披露原生全模态智能体的架构设计、训练方案与评测结果,为全模态模型落地Agent场景提供技术参考。
- Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model:针对MiniMax-H3全模态模型的物理世界推理能力展开评测,验证全模态模型在多视角空间推理、音频消歧等任务上的表现。
- OmniFysics-Nano-V2 Technical Report: Understanding the Physical World Across Modalities:提出跨模态物理世界理解模型OmniFysics-Nano-V2,可实现多模态输入下的物理规则推理,支撑具身智能、机器人控制等场景。
具身智能
厂商动态
- 全球首台搭载全国产化电子架构的具身智能机器人亮相 [央视新闻]:该架构打通国产AI芯片、鸿道Intewell工业操作系统、AUTBUS确定性总线、MaVIEW开发工具四大核心模块,实现控制与AI智能计算的隔离融合,构建从AI决策到物理执行的全国产化技术底座,可完整替代国外方案。
- 具身智能落地文旅消费场景 [中国经济网]:9月24日焕新开园的珠海长隆飞船乐园已部署多款具身智能机器人,覆盖演艺、科普、导览、互动娱乐等场景,提供书法创作、乒乓球互动、讲解导览等服务,标志着具身智能从工业、实验室场景向大众消费场景渗透。
- 中国移动推动具身智能产业生态建设 [新华网]:在浙江余杭具身智能产业对接会上发布机械臂、电池、关节模组等零部件配套需求,与50余家具身智能产业链企业对接,共同启动浙江省产业链对接智能体平台,完善具身智能产业供应链。
- Google DeepMind发布Gemini Robotics 2模型 [Google DeepMind官方]:作为最新一代VLA(视觉-语言-行动)模型,可智能控制各类机器人,覆盖双臂机器人、移动机器人、工业机械臂等多形态硬件,是机器人的通用智能层。
arXiv论文
- EmbodiedMind: Adaptive Data Curation and Prefix-Tree Reinforcement Learning for Efficient Embodied Intelligence:提出自适应数据 curated 与前缀树强化学习框架,提升具身智能的训练效率与环境适应能力。
- Know Your Body: A Harness for Direct and Self-Improving Robot Control with VLMs:提出基于视觉语言模型的机器人自改进控制框架,让机器人可自主感知本体状态、优化控制策略,降低硬件适配成本。
- Neurosymbolic Embodied Agents:提出神经符号具身智能体架构,结合神经网络的感知能力与符号系统的推理能力,提升具身智能在复杂任务中的决策准确性。
本周趋势观察
本周AI领域呈现三大清晰趋势:一是大模型“分层供给”格局成型,既有小米MiMo-V2.6、智谱GLM-5.3-FlashX等高性价比开源模型降低使用门槛,也有GPT-6系列、Sonnet 5.5等闭源前沿模型冲击性能上限,同时模型降本与安全治理同步推进,行业从“重性能”转向“性能、成本、安全平衡”。二是全模态模型向“端侧落地”与“Agent化”双方向演进,端侧模型如AutoOmni2.0已经实现小参数媲美大模型效果,云端全模态模型如Qwen3.8-Omni-Flash则重点强化任务规划、工具调用能力,加速从“内容理解”向“行动执行”升级。三是具身智能进入“底层技术自主+场景规模化落地”阶段,全国产化电子架构突破了核心技术卡脖子问题,同时文旅、工业等场景已经出现批量落地案例,产业从技术验证期正式进入价值兑现期。