今日速览
- 小米发布并开源MiMo-V2.6系列全模态大模型,登顶Artificial Analysis全球开源榜,性能、速度、成本兼顾进入第一梯队。
- OpenAI推出GPT-6 Sol、Luna两款低成本模型,Anthropic同步跟进平价模型更新,头部厂商加速大模型普惠落地。
- 阿里上线Qwen3.8-Omni-Flash全模态模型,支持1M上下文,音视频能力提升超26%,API成本最高降98%。
- 具身智能进入技术落地关键期,Figure、宇树科技、灵初智能等多厂商密集发布新一代具身模型,广东已有超2000台具身机器人进入工业场景。
- 高德发布空间智能AI平台,构建从空间还原到行业行动的完整链路,推动智慧城市自主进化。
大模型
厂商动态
- 小米:正式发布并开源新一代MiMo-V2.6系列大模型,包含Pro与Flash两款,已登顶Artificial Analysis全球开源大模型榜单,获Hugging Face CEO公开称赞,在第一梯队模型中实现性能、速度、价格三者兼顾。
- OpenAI:9月22日新增GPT-6 Sol与GPT-6 Luna两款低成本模型,聚焦日常工作场景,平衡前沿能力与使用成本;9月10日上线GPT-Live-1语音模型,为API带来全双工自然语音对话能力,支持自定义语音与电话场景。
- NVIDIA:发布NIM 1.4.0版本,新增对Gemma 2 9B模型的支持,优化推理部署能力。
- Meta:开放Muse Spark 1.1模型公共预览,支持“思考”模式,已上线Meta AI应用与meta.ai平台,开发者可通过Meta Model API调用。
- Google DeepMind:Gemini 2.5 Flash-Lite正式上线,2.5 Pro、Flash版本进入稳定可用阶段,推荐新项目优先使用3.5 Flash-Lite或3.8 Flash模型。
arXiv论文
- 提出大模型偏好对齐的零阶范式,无需梯度信息即可完成偏好优化,降低对齐成本,相关成果共39页,收录于cs.CL领域。
- 研究大模型并行训练中的关键窗口与性能隔离问题,探索不同训练策略对模型效果的影响,收录于cs.RO领域(arXiv:2609.20539)。
AI 应用
厂商动态
- 高德:2026云栖大会期间发布空间智能AI平台,同时推出全空间无人体系、高德千舆等产品,构建从空间还原、行业分析到落地行动的完整链路,能力正式向产业规模化开放。
- 阿里巴巴:云栖大会集中展示AI全栈布局,覆盖AI芯片、大模型、AI云、企业级Agent应用等领域,CEO吴泳铭提出“智能将成为可规模化供给的商品”,判断未来机器思考总量或达人类10倍。
- OpenAI:宣布ChatGPT Work即将上线,具备企业级管控能力,支持自动执行后台任务、生成文档/简报/表格,兼容常用工具与插件,ChatGPT Business和Enterprise方案均可使用。
- Google:调整Gemini 2.5系列模型访问权限,仅向历史活跃用户开放,新项目推荐使用3.5 Flash-Lite或3.8 Flash版本,保障服务稳定性。
- Mistral AI:升级Vibe智能体,支持长周期任务处理,可结合企业私有知识与工具完成复杂工作流,配套Studio平台提供agent编排、状态持久化、失败自动重试等能力。
arXiv论文
- 发布AI科研智能体递归自改进研究,验证智能体可自主迭代优化科研能力,降低科研工作的人力成本。
- 提出动作相似性监督方法,提升潜在动作模型的跨具身迁移能力,降低不同机器人形态的技能适配成本(arXiv:2609.19846)。
多模态
厂商动态
- 小米MiMo-V2.6系列:原生支持图片、视频、音频、文本全模态输入,除Pro与Flash版本外,同步上线Pro-Ultraspeed超高速模式与MiMo Desktop桌面客户端,兼顾旗舰性能与高效推理场景。
- Meta:发布Muse Image、Muse Video多模态生成模型,二者基于同一预训练基座,Muse Video原生支持音频,视觉保真度表现优异,已上线Meta AI应用、meta.ai及Instagram平台。
- OpenAI:研究方向覆盖图像、音频、视频多模态生成,旗下Sora视频生成模型可实现世界模拟,Images 2.5支持更精细的图像生成与编辑,音频模型推动语音识别与音乐创作能力升级。
- Mistral AI:宣布Pixtral 12B多模态模型停止维护,由更新更强的视觉与多模态模型替代,建议开发者迁移至新系列模型。
arXiv论文
- 提出双层学习框架Anchoring What Matters,优化视觉多模态任务的关键信息捕捉能力,提升理解准确性。
- 发布MM-ContextFold方法,针对多模态智能体检索场景优化上下文折叠能力,提升跨模态信息检索效率(arXiv:2609.23121)。
- 推出认知结构化多模态智能体框架,可同时实现多模态理解、生成与编辑能力,覆盖更复杂的多模态任务场景(arXiv:2607.08497v1)。
Omni 全模态
厂商动态
- 阿里千问:正式上线Qwen3.8-Omni-Flash原生全模态模型,支持文本、图像、音频、视频同时输入,上下文长度达1M;相比上一代,30项评测平均得分提升超26%,音视频理解与生成能力显著增强,API成本最高下降98%,已在千问AI平台、阿里云百炼开放使用,具备音视频生产编辑、视频问答等Agent能力。
- Google DeepMind:推出Gemini Omni全模态模型,主打高分辨率视频生成与编辑能力,可实现多模态输入到视频输出的端到端处理。
- Meta:Llama 4 Scout为原生全模态模型,兼顾易部署性、成本效率与性能,可支持数十亿用户规模的应用场景。
- OpenAI:GPT-4 Omni(GPT-4o)支持音频、视觉、文本实时推理,是旗下旗舰全模态模型,可实现低延迟多模态交互。
arXiv论文
- 发布全模态生成模型MiniMax-H3评估研究,验证其具备多视角空间推理、音频消歧推理、视频决策等物理世界推理能力(arXiv:2609.18323)。
- 推出S1-Omni统一多模态推理模型,面向科学场景,支持科学理解、预测与生成任务(arXiv:2607.15686v1)。
- 发布OmniACBench评测基准,专门评估全模态模型的上下文感知声学控制能力,补全全模态模型能力评测维度(arXiv:2603.23938)。
具身智能
厂商动态
- 模型密集更新:海外Figure发布Helix 2.5神经网络模型,可支持机器人自主完成家务操作;国内宇树科技开源通用人形机器人基础模型LM-WLA-1.0,可驱动机器人完成64项操作任务;灵初智能发布新一代具身基础模型Psi-R2.5,将新任务学习所需的真人示范次数从50次降低至1次,实现类Prompt的任务泛化。
- 产业落地加速:广东已有超2000台具身智能机器人进入工业场景,覆盖分拣、上下料、巡检、协同作业等工序,9月22日集中签约8个应用项目,启动省属国企与人形机器人“十骏”企业结对;成都经开区发布具身智能实景实训基地共建计划,联合18家头部企业探索工业场景落地路径。
- 产学研合作推进:西安电子科技大学与云天励飞揭牌具身智能联合实验室,围绕机器人仿真、大模型端侧部署、国产芯片适配等方向联合攻关;全国已有超70家机构启用“机器人学校”训练场,通过动作捕捉采集真人操作数据作为机器人训练教材。
- Google DeepMind:发布Gemini Robotics 2,是当前最先进的视觉-语言-动作(VLA)模型,可将视觉与语言输入直接转换为机器人动作,支持全机身智能控制。
arXiv论文
- 发布MachEmbodied-U0统一具身智能理解与生成模型,实现具身场景下感知、决策、动作的统一建模(arXiv:2609.25627)。
- 提出ME-Brain-1.0框架,整合记忆、认知、行动能力,支持具身智能在动态环境中持续进化(arXiv:2609.24271)。
- 研究神经符号具身智能体方法,结合神经网络感知能力与符号推理能力,提升具身任务的决策可解释性与泛化性(arXiv:2608.16794v2)。
本周趋势观察
本周行业呈现三大明确趋势:一是大模型普惠化加速,OpenAI、Anthropic同步推出低成本版本,小米开源第一梯队全模态模型,头部厂商正在快速拉低前沿大模型的使用门槛,性能、成本、推理速度的三角平衡已进入落地阶段;二是全模态模型从“理解”向“行动”升级,Qwen3.8-Omni-Flash、MiMo-V2.6等新模型均强调Agent能力,可基于多模态输入直接完成任务规划、工具调用、内容创作,不再局限于内容理解场景;三是具身智能进入技术与产业双突破期,核心模型迭代速度显著加快,数据范式革新大幅降低新任务学习成本,同时工业场景已从单点示范转向规模化复制,国内已有超2000台设备落地,“具身智能的ChatGPT时刻”已经进入行业讨论视野,预计未来2-5年将迎来应用爆发。