Back

AI 每日调研 · 2026年09月22日|小米MiMo-V2.6登顶开源大模型榜首、具身智能量产落地

今日速览

  1. 小米发布并开源MiMo-V2.6系列全模态大模型,登顶Artificial Analysis全球开源大模型榜单,Pro版得分领先国内同类产品。
  2. 阶跃星辰发布新一代旗舰基座模型Step 5 Preview,跻身AA榜单全球开源前三,计划10月15日开放完整权重。
  3. 高德在云栖大会发布全空间无人体系及“高德千舆”空间智能开放平台,面向无人设备、开发者开放空间数据与感知能力。
  4. 消费级具身智能产品启动规模化交付,智身科技具身机器人累计量产突破1.5万台,启元系列个人机器人接入腾讯WorkBuddy技能库。
  5. arXiv新增全模态模型物理推理能力评估、具身智能神经符号架构等方向的最新研究成果。

大模型

厂商动态

  • 小米于9月22日正式发布并开源Xiaomi MiMo-V2.6系列,包含Pro与Flash两个版本,是其探索RSI(递归自我改进)路径的关键进展。该系列模型在Artificial Analysis测评中登顶全球开源大模型榜首,Pro版得分46,领先Kimi K3与Qwen3.8 Max,API定价沿用V2.5系列标准,成本仅为海外同类模型的1/20至1/60 经济参考网新浪新闻
  • 上海阶跃星辰发布新一代旗舰基座模型Step 5 Preview,目前已开放第三方接口,将于10月15日全面开源完整权重,跻身Artificial Analysis全球开源大模型榜单前三,在同等成本下实现了更高的智能表现 人民网上海
  • NVIDIA推出NIM for LLMs 1.4.0版本,新增对Gemma 2 9B模型的支持 NVIDIA官方文档
  • OpenAI面向企业推出ChatGPT-6 Astra旗舰模型与ChatGPT Work企业级服务,支持企业级管控与常用工具集成,可自动执行后台任务、生成办公文档 OpenAI企业页

arXiv论文

  • 提出大模型偏好对齐的零阶范式,无需依赖梯度信息即可完成偏好优化,相关研究共39页,覆盖计算语言学与人工智能方向 arXiv:2609.19144
  • 探索大模型训练中的并行性、临界窗口与能力分离问题,共27页10幅图表,聚焦机器人领域大模型适配方向 arXiv:2609.20539

AI应用

厂商动态

  • 高德在2026云栖大会发布全空间无人体系及“高德千舆”空间智能开放平台,将地图积累的空间数据、实时感知能力向城市治理、无人物流、终端设备开放,已在江苏常州落地工业物流、医疗物资运输场景应用 经济观察网
  • 联想亮相2026云栖大会,展示混合式AI布局,包括万全异构智算方案、擎天AI平台、天禧AI个人超级智能体等成果,覆盖混合词元工厂、个人智能、企业智能三大方向 头条
  • OpenAI于9月16日发布AI广告工具链,包含赞助智能体、营销人员工具套件,已实现与HubSpot、Shopify的集成 OpenAI产品动态
  • 剪映于9月20日发布剪映Hub一站式创作工作台、AI创作助手“小映”等功能,支持从一句话、参考视频或文档启动创作,解决创作者多工具切换、重复操作痛点 科技日报

arXiv论文

  • 提出连续时间语言智能体架构,解决长周期任务中状态持久化与决策连续性问题 arXiv:2609.17414
  • 提出基于物理约束的AI生成音视频检测方法PIVOT,提升生成内容的真伪识别准确率 arXiv:2609.15562
  • 语言模型智能体可复现人类最小群体行为偏差,为AI社会心理学研究提供量化依据,相关成果收录于物理与社会方向 arXiv:2609.00009

多模态

厂商动态

  • 青海师范大学藏语智能全国重点实验室发布国内首款藏语多语言全模态AI输入法“智达AI输入法”及配套藏文字库,支持手机、电脑全终端,覆盖文字、语音、图像等多模态输入 中国西藏网中国日报网
  • 商汤发布SenseNova U1.5原生统一多模态模型,采用8B-MoT架构,无需外部视觉编码器与VAE即可实现视觉内容的理解、推理与生成,支持最高4K原生分辨率训练 商汤科技
  • 智象未来发布原生全模态视频生成模型HiDream-O1-Video-1.0,基于其世界模型架构HiDream-O1开发,推动AI视频从素材生成向完整作品交付演进 新华网合肥高新区管委会

arXiv论文

  • 面向对话场景的多模态情感识别研究,融合文本、语音、视觉特征提升情绪识别准确率 arXiv:2609.09924
  • 多模态问答技术演进综述,梳理了从模态自适应提取到统一语言表示的技术发展路径 arXiv:2609.08896
  • 发布工业CAD场景多模态基础模型套件VisCAD,支持工程图纸理解、参数化建模等工业场景任务 arXiv:2609.03811

Omni 全模态

厂商动态

  • 阿里千问上线Qwen3.8-Omni-Flash原生全模态模型,支持文本、图像、音频、视频输入,上下文长度达1M,相比上一代在30项评测中平均得分提升超26%,音视频理解与生成能力显著增强,API成本最高下降98%。该模型具备全链路音视频Agent能力,可自主完成素材理解、信息提炼、剪辑创作全流程任务 钛媒体DoNews
  • Google DeepMind发布Gemini Omni全模态模型,主打高分辨率视频生成与编辑能力,可基于任意输入生成内容,已逐步向全球多区域开放 Google DeepMindGemini Omni官方页
  • NVIDIA NeMo AutoModel新增全模态模型支持,可一站式运行、微调主流Omni模型 NVIDIA NeMo文档

arXiv论文

  • 对MiniMax-H3全模态生成模型的物理世界推理能力进行评估,覆盖多视角空间推理、音频消歧推理、视频决策等核心能力维度 arXiv:2609.18323
  • 发布全模态模型上下文感知声学控制评测基准OmniACBench,填补了音视频协同场景下的能力评估空白 arXiv:2603.23938

具身智能

厂商动态

  • 具身智能产业进入规模化落地阶段:上纬新材发布启元Q1、启元T1两款消费级个人机器人,售价19999元起,已接入腾讯WorkBuddy可调用上万种技能;智身科技宣布完成B轮融资,其具身智能机器人累计量产突破1.5万台 经济参考网新浪财经
  • 清华大学、无问芯穹、正行创新联合开源具身智能体基础设施RPent,将任务理解规划、VLA精细操作、记忆与机器人接口打通,形成感知-决策-执行-反馈完整闭环,可实现具身任务效率提升7倍 科技日报
  • 我国首个具身智能数据要素跨境流通服务贸易平台正式发布,由北京石景山科创集团联合中国电信北京分公司共建,为行业提供合规的数据跨境流通服务 科技日报
  • 具身智能落地场景持续拓展:安徽芜湖“芜优智警R001”机器人交警已实习上岗,违法识别准确率94%,试点区域违停率下降67%;四足运载机器人可驮300公斤负载完成山地运输任务 新浪新闻
  • Google DeepMind发布Gemini Robotics 2视觉-语言-动作(VLA)模型,为机器人提供全身智能支持,可实现复杂任务序列的自主学习与环境适配 Google DeepMind

arXiv论文

  • 提出神经符号具身智能体架构,将符号推理与感知能力结合,解决离散长周期家庭任务的规划与执行问题 arXiv:2608.16794v2
  • 发布具身第一人称视角仿真环境AnchorWorld,支持基于视角的环境演化自定义,为具身智能训练提供高拟真仿真支撑 arXiv:2606.07326v1
  • 提出开放世界物理智能路线图,梳理了从世界动作模型到具身大脑的技术演进路径,为通用具身智能研发提供框架参考 arXiv:2607.11689

本周趋势观察

  1. 开源大模型竞争进入“性能+成本”双维度比拼阶段,小米MiMo-V2.6、阶跃Step 5 Preview等国产模型在权威测评中跻身全球前列,同时API成本仅为海外模型的数十分之一,将进一步推动大模型在中长尾场景的普及。
  2. 全模态模型从“内容理解”向“任务执行”升级,Qwen3.8-Omni-Flash等产品已实现音视频全工作流自主处理,Agent能力与多模态感知的融合成为当前产业落地的核心方向。
  3. 具身智能正式从技术验证期进入规模落地期,消费级产品售价下探至2万元级别,工业级场景已实现万台级量产,同时配套的开源基础设施、数据流通平台逐步完善,产业生态正快速成熟。
  4. 2026云栖大会释放明确信号,AI技术重心从底层模型突破转向产业价值落地,混合式AI、空间智能、Agentic AI等方向成为产业侧关注的核心赛道。

评论