今日速览
- 国内首个通用具身智能训练平台正式对外开放,支持多形态智能体"看学做"一站式训练
- Cohere Embed 5嵌入模型正式上线,官方已发布完整技术细节与可用性说明
- 多模态领域arxiv新增《Gestalt: Large Multimodal Interplay Model》成果,聚焦跨模态交互优化
- 全模态领域最新研究围绕物理世界推理、Agent决策规划方向展开技术探索
- 生成式AI应用渗透加速,我国上半年用户规模已突破7亿人
大模型
厂商动态
- Cohere 9月30日正式发布Embed 5嵌入模型,官方已更新完整Release Notes,包含技术参数、可用范围等细节[来源:Cohere]
- 9月29日曾报道OpenAI推出GPT-6.1 Sol,现补充:官方明确其Token价格不到Astra标准价格的一半,能力接近Astra,可支撑高难度编程与专业工作场景需求[来源:OpenAI Research]
- 小米MiMo-V2.6系列、Anthropic Sonnet 5.5、OpenAI暂停GPT-6.1 Astra发布等动态近5天已连续报道,当日无新增信息,暂不展开
arXiv 论文
- Hierarchical Continuous Diffusion Language Models:提出层级连续扩散语言模型架构,探索扩散范式在自然语言生成领域的落地潜力
- JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution:提出即时演化的智能体框架架构,优化记忆管理、规划策略等核心组件的适配效率
AI 应用
厂商动态
- 中国互联网络信息中心发布《生成式人工智能应用发展报告(2026)》[来源:数字中国建设峰会],截至2026年上半年我国生成式AI用户规模突破7亿,36.1%网民使用手机自带AI助手,35.5%使用移动端AI应用
- 阿里开源Qwen-Image-Layered图像生成模型,首次实现模型内PS级图层理解与生成,可完成近乎零漂移的AI图像精准编辑,解决生图一致性难题
- Mistral上线OCR 4.1文档理解模型,定价为每1000页4美元,号称当前全球精度最高的文档提取模型[来源:Mistral Pricing]
- OpenAI推出面向金融行业的ChatGPT解决方案,搭载GPT-6 Astra模型与专属金融数据工具,覆盖研究、分析、运营等场景[来源:OpenAI金融行业方案]
arXiv 论文
- Empty Commitments: When Agents Promise What They Cannot Deliver:聚焦智能体行为可信性问题,量化分析当前AI Agent在任务承诺与执行能力上的 mismatch 现象
多模态
厂商动态
- 微软研究院发布BEiT-3通用多模态基础模型,实现文本、图像、多模态预训练架构统一,在20余项多模态基准测试中取得SOTA结果
- 新浪科技行业报告显示AI语音助手正加速向多模态融合交互演进,2026年汽车座舱已成为"语音+视觉+触控+环境感知"多模态交互的核心落地场景
arXiv 论文
- Gestalt: Large Multimodal Interplay Model:提出类格式塔的多模态交互框架,优化跨模态信息的关联推理能力,在12项多模态理解任务中平均精度提升8.7%
- Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces:提出嵌入空间内语言与视觉的统一流建模方法,简化多模态任务的适配流程
Omni 全模态
厂商动态
- NVIDIA官方文档已支持Qwen3-Omni全模态模型的训练与部署,提供开箱即用的微调配方与Hugging Face模型卡适配
- 9月23日曾报道斑马智能发布AutoOmni2.0端侧全模态模型,现补充:该模型为23B混合专家架构,普通任务处理能力堪比10倍参数量云模型,复杂任务性能达到云模型的80%[来源:新华网]
- 谷歌Gemini Omni开放视频生成与编辑能力,支持多模态输入直接生成高保真视频内容[来源:Google DeepMind]
arXiv 论文
- OmniFysics-Nano-V2 Technical Report: Understanding the Physical World Across Modalities:提出跨模态物理世界理解模型,在多视角空间推理、音频消歧等任务上性能提升15%以上
- Omni-Decision: Evidence-Ledger Planning for Omni-Modal Agents:提出基于证据账本的全模态智能体规划框架,降低复杂任务执行的决策错误率
具身智能
厂商动态
- 国内首个通用具身智能训练平台正式对外开放,集成仿真训练、真机部署、数据闭环能力,支持工业机械臂、服务机器人、人形机器人等多形态智能体,可实现"看一眼、学一遍、做一遍"的技能学习,无需固定示教路径
- 新松公司发布松羿力量版轮式具身智能机器人,负载达15千克,适配搬运、检测、分拣等工业场景,支持即插即用与多机协同作业[来源:北国网]
- 9月28日曾报道东土科技发布全国产化电子架构具身智能机器人,现补充:该架构以确定性计算与网络技术为基础,实现控制与AI计算的隔离融合,已通过国家工业信息安全发展研究中心测试,可完整替代国外同类方案[来源:东方财富网]
arXiv 论文
- Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents:提出具身智能体引导式自提升框架,通过环境重建、模拟练习、真机迭代三步法,降低技能落地的真机调试成本60%以上
- Explore, Execute, Evolve: A Skill Acquisition and Reuse Loop for Embodied Agents:提出具身智能体的技能获取与复用闭环,实现跨场景技能迁移,平均新任务学习效率提升2.3倍
本周趋势观察
本周AI领域呈现三个明确的落地导向:一是大模型竞争从参数、性能比拼转向性价比与场景适配,OpenAI GPT-6.1 Sol、Cohere Embed 5等产品均以"同等能力更低成本"为核心卖点,产业侧对大模型的采购决策愈发理性;二是具身智能从单点技术突破转向体系化落地,通用训练平台、全国产电子架构、场景规模化部署三条路径并行,2026年Q4有望迎来工业场景具身机器人的密集落地期;三是多模态/全模态技术的价值落点从"理解"转向"执行",Qwen3.8-Omni-Flash、Gemini Omni等产品均强化Agent任务规划、工具调用能力,全模态模型正在从内容交互入口升级为生产力执行入口。