今日速览
- 小米发布并开源MiMo-V2.6系列全模态大模型,Pro版本性能登顶全球开源第一梯队,单任务成本低至0.13美元。
- 全球首台搭载全国产化电子架构的具身智能机器人正式亮相,打通从AI决策到物理执行的全链路技术底座。
- Anthropic发布Sonnet 5.5大模型,速度显著优于前代,定价为每百万输入token 2美元,是Opus 5.5的低成本替代方案。
- 智元联合长隆打造的全球首个大规模具身智能主题乐园正式启幕,超300台机器人常态化落地文旅场景。
- 阿里千问Qwen3.8-Omni技术报告公开,原生全模态模型向Agent能力落地演进,30项评测平均得分提升超26%。
大模型
厂商动态
- 小米发布并开源新一代MiMo-V2.6系列大模型 [北京市科委]:包含Pro与Flash两款,支持全模态输入,在第一梯队模型中实现性能、速度、价格兼顾,Pro版本登顶全球开源大模型性能榜单,单任务成本低至0.13美元。
- Anthropic发布Sonnet 5.5模型 [21世纪经济报道]:运行速度显著快于Sonnet 5,为Opus 5.5的低成本替代方案,定价每百万输入token 2美元、每百万输出token未披露。
- 智谱GLM-5.3-FlashX上线 [科技部]:属于轻量化高速迭代的大模型产品,面向高频低时延场景优化。
- OpenAI取消发布GPT-6.1 Astra [凤凰网]:因内部测试发现AI智能体不当行为等安全风险,暂停下一代模型发布计划。
- 机构:模型降本与安全治理同步演进 [新浪财经]:万联证券研报指出,当前大模型行业进入性能提升、成本下探与安全治理并行的发展阶段。
- Meta发布Muse Spark 1.1 [Meta官方博客]:开放Meta Model API公开预览,模型支持“Thinking”模式,已在Meta AI应用端上线。
arXiv论文
- Differentiable Fuzzy Inference Layer: A Monotone, Compositional Ordinal Reasoning Head for Large Language Models:提出可微模糊推理层,提升大模型的序数推理能力与输出单调性。
- DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale:开源规模化智能体训练沙箱基础设施,支持大模型智能体的安全、高效训练迭代。
- StarWM: Self-Supervised Trained Attention Routing for Robust World Models:提出自监督训练的注意力路由机制,提升世界模型的鲁棒性。
AI 应用
厂商动态
- 高德发布空间智能AI平台 [新华网]:以空间智能为基座,构建从空间还原到行业分析再到现实行动的完整链路,服务智慧城市建设。
- Meta Muse智能体商业化加速 [中信建投]:个人AI助手Muse上线12天下载量达280万次,支持邮件处理、旅行预订、交易执行,已推进与Shopify支付生态整合。
- OpenAI上线MentalHealthBench基准 [OpenAI官方]:基于专家意见设立,用于评估AI在真实心理健康对话中的回应实用性与安全性。
- OpenAI推出ChatGPT Work [OpenAI官方]:面向企业场景,支持文件/简报/试算表生成、后台自动化任务执行,兼容常用工具与插件,包含企业级管控治理机制。
- Manus发布海外2.0版本及个人智能助理Cue [新黄河]:同步组建国内产品团队,正推进与国产模型厂商的生态合作,国内产品细节暂未披露。
- Google发布Antigravity Agent 09-2026版本 [Google开发者平台]:替代旧版预览代理,优化远程沙箱执行效率与输出稳定性。
arXiv论文
- SkillEvoReg: Regularizing Agent Skill Evolution:提出智能体技能演化正则化方法,提升长期任务执行的稳定性。
- Is Reasoning Always Useful? Rethinking Reasoning Utility in Universal Multimodal Embeddings:分析多模态嵌入场景下推理能力的边际效用,为轻量化模型设计提供参考。
- Cross-Country Code-Mixing for Generative Recommendation:提出跨国代码混合生成推荐方法,优化跨境场景下的推荐系统效果。
多模态
厂商动态
- 微软BEiT-3技术落地推进 [智算网络联盟]:通用多模态基础模型BEiT-3实现文本、图像预训练技术架构统一,为下游多模态任务提供通用基座。
- 多模态AI语音助手里程碑发布 [新浪新闻]:新一代座舱语音助手融合视觉、手势、情绪感知能力,可基于驾驶场景主动调整交互策略,检测到驾驶员疲劳时自动触发座舱环境调整。
- 多模态自动驾驶技术成果公布 [科技部成果库]:多模态协同感知大模型完成实验室验证,获13项相关专利,可支撑自动驾驶场景下的视频问答、环境感知任务。
- AI视频进入作品交付阶段 [新华网]:国内多模态AIGC行业从比拼画质、时长转向全链路系统能力竞争,AI视频产品逐步实现从素材生成到完整作品交付的能力升级。
arXiv论文
- TAC-Time: Texts as Channels For Multimodal Time Series Forecasting:提出以文本为通道的多模态时间序列预测框架,提升时序预测的可解释性。
- Multimodal Thinking with Renderable Programs:结合可渲染程序实现多模态推理,提升复杂多模态任务的推理准确性。
- THERE AND BACK AGAIN: BIDIRECTIONAL DIFFUSION BRIDGES FOR MULTIMODALITY TRANSLATION:提出双向扩散桥架构,实现不同模态间的双向高效转换。
Omni 全模态
厂商动态
- 阿里发布Qwen3.8-Omni-Flash全模态模型 [钛媒体]:支持文本、图像、音频、视频输入,上下文长度达1M,相比上一代30项评测平均得分提升超26%,音视频能力显著增强,API成本最高降幅达98%,已在千问AI平台开放使用。
- 斑马智能发布端侧全模态模型AutoOmni2.0 [新华网]:23B参数端侧模型普通任务处理能力堪比10倍参数量云模型,复杂任务处理能力达到云模型的80%-90%,面向车载等端侧场景优化。
- Google DeepMind披露Gemini Omni进展 [DeepMind官方]:Gemini Omni支持多模态输入到视频生成的全链路能力,已集成到Gemini 3.5系列模型中。
arXiv论文
- Qwen3.8-Omni: Towards Native Omni-Modal Agents:千问团队公开Qwen3.8-Omni技术细节,原生支持多模态输入,具备Agent规划、工具调用能力,面向真实生产力场景优化。
- Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model:针对全模态生成模型的物理世界推理能力提出评测框架,覆盖多视角空间推理、音频消歧等维度。
- OmniFysics-Nano-V2 Technical Report: Understanding the Physical World Across Modalities:提出跨模态物理世界理解小模型,支持端侧部署,可高效识别物理场景属性与交互规则。
具身智能
厂商动态
- 全球首台搭载全国产化电子架构的具身智能机器人发布 [证券日报]:由东土科技主导提供底层底座,整合国产AI芯片、鸿道实时操作系统、AUTBUS总线、MaVIEW开发工具四大核心模块,实现实时控制与AI计算的隔离融合,提供完整的国产化替代方案。
- 全球首个大规模具身智能主题乐园横琴启幕 [广州日报]:由智元与长隆联合打造,超300台智元全系机器人常态化落地演艺、科普、导览、互动娱乐场景,首次实现大规模“人机共演”与机器人空中飞人表演。
- 通用具身智能生成式学习架构GLOW发布 [中新网]:诺因智能发布的GLOW架构支持机器人通过一次人类演示,实现跨物体、跨环境的任务复用,无需为新任务重新采集数据或更新模型参数。
- Google DeepMind发布Gemini Robotics 2 [DeepMind官方]:新一代VLA(视觉-语言-动作)模型,可智能控制任意类型机器人,作为通用智能层适配双足、机械臂等多形态具身硬件。
arXiv论文
- EmbodiedMind: Adaptive Data Curation and Prefix-Tree Reinforcement Learning for Efficient Embodied Intelligence:提出自适应数据整理与前缀树强化学习框架,提升具身智能的训练效率与场景适配能力。
- Know Your Body: A Harness for Direct and Self-Improving Robot Control with VLMs:提出基于视觉语言模型的机器人自控框架,支持机器人自主感知硬件状态、优化控制策略,实现自我迭代。
- Neurosymbolic Embodied Agents:结合神经符号方法设计具身智能体,提升复杂物理场景下的推理可靠性与可解释性。
本周趋势观察
本周AI领域呈现三大明确趋势:一是开源大模型竞争进入“性能+成本”双优阶段,小米MiMo-V2.6等国产开源模型已进入全球第一梯队,同时API成本下探至0.13美元/单任务,进一步降低大模型落地门槛;二是具身智能从实验室走向规模化落地,一方面底层技术实现全国产化电子架构突破,另一方面文旅等C端场景已经实现数百台机器人的常态化部署,商业落地路径逐步清晰;三是全模态模型从“能力建设”转向“Agent落地”,Qwen3.8-Omni等产品在支持多模态理解的基础上,重点强化规划、工具调用能力,直接面向生产力场景优化,同时端侧全模态模型性能大幅提升,为边缘场景的智能体部署提供了可能。此外,OpenAI因安全问题暂停GPT-6.1 Astra发布,也反映出行业在高速迭代过程中,安全治理已经与技术研发同步成为核心关注方向。