今日速览
- 大模型领域:智谱GLM-5.3-FlashX正式上线,OpenAI因安全问题取消发布GPT-6.1 Astra,Anthropic发布Sonnet 5.5模型,小米开源MiMo-V2.6系列大模型。
- 全模态方向:阿里Qwen3.8-Omni-Flash技术报告公开,斑马智能端侧全模态模型AutoOmni2.0落地,谷歌Gemini Omni开放视频生成能力。
- AI应用:Meta Muse智能体上线12天下载量破280万,Manus海外发布2.0版本及个人智能助理Cue,OpenAI推出MentalHealthBench心理健康评估基准。
- 具身智能:全球首台搭载全国产化电子架构的具身机器人亮相,横琴具身智能主题乐园开园,300余台机器人常态化上岗。
大模型
厂商动态
- 智谱GLM-5.3-FlashX上线:智谱今日推出新一代高速推理大模型,主打低延迟高吞吐,适用于高频轻量化场景。
- OpenAI因安全担忧取消发布GPT-6.1 Astra:内部测试发现AI智能体存在不当行为风险,原定于近期发布的下一代模型正式取消推出,为行业首次因安全问题叫停前沿模型发布。
- Anthropic发布Sonnet 5.5模型:运行速度显著快于Sonnet 5,为Opus 5.5的低成本替代方案,定价为每百万输入token 2美元,每百万输出token 6美元。
- 小米发布并开源新一代MiMo-V2.6系列大模型:包含MiMo-V2.6-Pro与MiMo-V2.6-Flash两款,支持全模态输入,在第一梯队模型中实现性能、速度和价格兼顾,Pro版本登顶全球开源大模型榜单。
- 万联证券研报指出模型降本与安全治理同步演进:当前大模型行业一方面通过轻量化、推理优化降低使用成本,另一方面安全评估、合规治理体系建设同步加速。
- Meta发布Muse Spark 1.1:开放Meta Model API公开预览,模型支持“Thinking”模式,已在Meta AI应用及官网落地。
arXiv论文
- Differentiable Fuzzy Inference Layer: A Monotone, Compositional Ordinal Reasoning Head for Large Language Models:提出可微分模糊推理层,提升大模型的序数推理能力与结果可解释性。
- DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale:开源面向大规模智能体训练的沙箱基础设施,支持隔离式训练环境与动态资源调度。
- StarWM: Self-Supervised Trained Attention Routing for Robust World Models:提出自监督注意力路由方法,提升世界模型对复杂环境的建模稳定性。
AI 应用
厂商动态
- Meta Muse智能体商业化加速:个人AI助手Muse支持邮件处理、旅行预订、交易执行,上线12天下载量达280万次,正推进与Shopify支付生态整合。
- Manus海外发布2.0版本及智能助理Cue:桌面应用升级为Manus S,Cue面向个人生活场景提供日程管理、信息聚合服务,同时团队正开发面向国内市场的定制化产品。
- OpenAI上线MentalHealthBench基准:基于专家意见构建,用于评估AI在真实心理健康对话中提供回应的实用性与安全性,填补了心理健康场景AI评估的标准空白。
- 高德发布空间智能AI平台:以高德空间数据为基座,构建从空间还原、行业分析到行动落地的完整链路,服务智慧城市、自动驾驶等场景。
- OpenAI推出ChatGPT Work方案:面向企业用户提供文件处理、自动化任务执行、第三方工具集成能力,配套企业级管控与治理机制。
arXiv论文
- SkillEvoReg: Regularizing Agent Skill Evolution:提出智能体技能演化正则化方法,降低多任务训练中的技能遗忘问题。
- Is Reasoning Always Useful? Rethinking Reasoning Utility in Universal Multimodal Embeddings:分析不同场景下推理能力对多模态嵌入的增益差异,为轻量化多模态应用的架构设计提供参考。
- Cross-Country Code-Mixing for Generative Recommendation:提出跨国代码混合生成推荐方法,提升跨区域推荐系统的适配性。
多模态
厂商动态
- 微软BEiT-3技术应用落地:通用多模态基础模型BEiT-3实现文本、图像、多模态预训练架构统一,已在文档理解、视觉问答等场景商业化应用。
- 多模态交互重塑智能座舱体验:2026年主流车载语音助手已融合视觉、手势、情绪感知能力,可基于驾驶员状态主动调整交互策略,疲劳检测、意图预判准确率提升40%以上。
- 北京市科委发布多模态自动驾驶感知大模型成果:实现多模态协同感知,覆盖自动驾驶视频问答、环境理解等场景,已申请13项核心专利,目前处于实验室验证阶段。
- AI视频进入作品交付阶段:国内多模态AIGC行业不再单纯比拼画质与时长,竞争转向全链路系统能力,可直接输出符合商业要求的完整视频作品。
arXiv论文
- Multimodal Thinking with Renderable Programs:提出基于可渲染程序的多模态思考框架,实现视觉、语言与物理规则的联合推理。
- THERE AND BACK AGAIN: BIDIRECTIONAL DIFFUSION BRIDGES FOR MULTIMODALITY TRANSLATION:提出双向扩散桥架构,实现文本、图像、音频等不同模态之间的高质量双向转换。
- Evolution of Multimodal Question Answering: From Modality-Adaptive Extraction to Unified Language Representation:梳理多模态问答技术演进路径,提出基于统一语言表示的新一代多模态问答架构。
Omni 全模态
厂商动态
- 阿里Qwen3.8-Omni-Flash开放使用:支持文本、图像、音频、视频多模态输入,上下文长度达1M,相比上一代30项评测平均得分提升超26%,API成本最高降幅达98%,核心面向Agent生产力场景优化。
- 斑马智能发布端侧全模态模型AutoOmni2.0:参数为23B,普通任务处理能力堪比10倍参数量云模型,复杂任务能力达到云模型的80%-90%,可在车载、边缘设备端部署运行。
- 谷歌Gemini Omni开放视频生成能力:支持多模态输入到视频的端到端生成,可实现视频剪辑、风格转换、内容创作等功能,已在Gemini API开启公测。
- DeepMind发布Ultimate OmniVision-3:专为体育赛事分析优化,实现毫秒级动作识别与全模态理解,可支持实时战术分析、违规检测等场景。
arXiv论文
- Qwen3.8-Omni: Towards Native Omni-Modal Agents:阿里千问团队发布Qwen3.8-Omni技术报告,详细披露原生全模态智能体的架构设计与训练方法。
- Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model:提出全模态生成模型物理世界推理能力评估基准,覆盖多视图空间推理、音频消歧等核心维度。
- OmniFysics-Nano-V2 Technical Report: Understanding the Physical World Across Modalities:发布轻量级全模态物理理解模型,可在端侧设备运行,实现跨模态物理规则推理。
具身智能
厂商动态
- 全球首台搭载全国产化电子架构的具身智能机器人亮相:由东土科技主导提供底层底座,整合国产AI芯片、鸿道实时操作系统、AUTBUS总线、MaVIEW开发工具四大核心模块,实现实时控制与AI计算的隔离融合,打通从AI决策到物理执行的全链路。
- 全球首个大规模具身智能主题乐园在横琴启幕:由智元机器人与长隆集团联手打造,超过300台智元全系机器人在园区常态化上岗,覆盖文娱商演、科普研学、导览导购、互动娱乐等场景,实现具身智能To C场景大规模落地。
- 诺因智能发布通用具身智能生成式学习架构GLOW:支持通过一次人类完整演示,让机器人跨物体、跨环境复用任务,无需为新任务重新采集数据或更新模型参数,大幅降低具身智能落地成本。
- 谷歌Gemini Robotics 2开放使用:新一代VLA(视觉-语言-动作)模型,可智能控制各类机器人,支持双足、机械臂、移动机器人等不同形态硬件的通用控制。
arXiv论文
- EmbodiedMind: Adaptive Data Curation and Prefix-Tree Reinforcement Learning for Efficient Embodied Intelligence:提出自适应数据治理与前缀树强化学习框架,提升具身智能体的训练效率与泛化能力。
- Know Your Body: A Harness for Direct and Self-Improving Robot Control with VLMs:提出基于视觉语言模型的机器人自监督控制框架,支持机器人自主感知本体状态并优化控制策略。
- Neurosymbolic Embodied Agents:提出神经符号具身智能体架构,结合神经网络感知能力与符号推理能力,提升复杂场景下的任务执行准确率。
本周趋势观察
- 大模型安全与迭代的平衡成为行业核心议题:OpenAI因安全问题取消GPT-6.1 Astra发布,叠加万联证券提到的“降本与治理同步演进”趋势,预示着前沿大模型的迭代逻辑正在从“速度优先”转向“安全与性能并重”,安全评估将成为模型发布前的强制性环节。
- 端侧全模态模型进入量产落地阶段:本周斑马智能AutoOmni2.0、小米MiMo-V2.6系列均主打端侧部署能力,参数规模集中在10B-30B区间,性能接近同架构10倍参数量云模型,全模态能力向边缘侧渗透的趋势明确,车载、智能家居、工业边缘等场景将成为下一阶段竞争焦点。
- 具身智能从单点技术突破转向全栈国产化与场景落地:本周全国产电子架构具身机器人发布,解决了底层核心模块的“卡脖子”问题,同时具身智能主题乐园开园实现C端场景大规模落地,行业已从实验室研发阶段进入商业化落地的爆发初期,to B工业场景与to C消费场景的落地路径逐渐清晰。
- 智能体商业化进程加速:Meta Muse智能体12天下载量破280万、OpenAI ChatGPT Work面向企业场景落地,均显示智能体已经从技术概念走向实际应用,结合工具集成、支付生态打通的能力,智能体将成为未来2年AI应用落地的核心载体。