Back

AI 每日调研 · 2026年09月17日|OpenAI GPT-6将发、Qwen3.8全模态模型上线

今日速览

  1. OpenAI 预告参数量超4万亿的GPT-6大模型1个月内发布,GPT-6 Astra已上线工作场景,大模型迭代带动算力产业链关注度提升。
  2. 阿里千问发布Qwen3.8-Omni-Flash原生全模态模型,支持1M上下文,音视频输入成本最高下降98%,全模态能力较上一代提升超25%。
  3. 紫东太初开源ZDTaichu5.0-9B多模态模型,重点强化空间感知、具身任务规划能力,九项空间理解评测表现优异。
  4. 中电信发布国内首个全栈国产轻量级智能体大模型星辰Xing4.0-29B-A4B,激活参数仅4B,适配复杂工程任务。
  5. 中国移动研究院发布“弈衡”三位一体具身智能评测体系,同步推出评测一体机及系列白皮书。

大模型

厂商动态

  • OpenAI:据中华网软件消息,参数量超4万亿的GPT-6大模型将于1个月内发布;此前9月3日已推出面向工作场景的GPT-6 Astra智能体模型东方财富网,OpenAI官网显示GPT-5于2025年8月发布,目前已开放GPT-6相关入口OpenAI官网
  • 中电信人工智能:发布新一代星辰大模型Xing4.0-29B-A4B,是国内首个全栈国产轻量级智能体大模型,采用MOE架构,总参数量29B、激活参数仅4B,聚焦复杂任务理解、工具调用等能力,适配代码开发、办公自动化等场景证券时报
  • 紫东太初:开源ZDTaichu5.0-9B多模态大模型,支持单图、多图、长序列视频及任意分辨率视觉输入,重点提升空间感知、跨视角变换、具身任务规划能力,在九项空间理解相关评测基准中表现突出,同步开放空间多模态数据生产方案上海证券报
  • Anthropic:9月1日发布Claude Fable 5.1及Mythos 5.1大模型,实现性能翻倍、成本下降,同时解决企业数据合规痛点央广网
  • 行业趋势:海内外大模型密集迭代,模型任务承接复杂度提升带动单次调用算力消耗上涨,海外云厂商资本开支持续高增,AI硬件全产业链关注度升温东方财富网

arXiv论文

  • arXiv:2609.17417《Knowledge as Orbit: Fini》,涉及人工智能领域知识表示相关研究,目前处于评审阶段arXiv
  • arXiv:2609.15051《Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinfo》,聚焦多模态强化学习场景下的提示词脚手架方法研究arXiv

AI应用

厂商动态

  • 网易有道:在AI Open Day发布LobsterAI 2.0及多场景Agent生态,覆盖办公、学习、营销等场景新华网
  • 移动云:发布国内首个国产GPU+类脑芯片大模型异构混合推理系统,通过全栈架构创新实现国产芯片对大模型的高效支撑人民邮电报
  • OpenAI:9月17日更新ChatGPT功能,ChatGPT for Word正式面向所有用户及ChatGPT Business套餐用户开放,支持草稿生成、内容总结等操作OpenAI帮助中心
  • 华为:在全联接大会推出基于九问的一体机开源Agent加速平台,内置SystemAgent,支持小时级企业端到端私有化部署,降低企业级Agent落地门槛新浪财经
  • 致远互联:发布AI原生能力底座CoMi AI Platform,作为AI-COP智能协同运营中枢的技术底座,支撑AI能力进入企业组织场景证券日报网
  • Meta:推出Muse Image和Muse Video生成模型,目前Muse Image已在Meta AI应用、Instagram Stories(美国)及部分国家WhatsApp上线,即将扩展至FacebookMeta AI博客

arXiv论文

  • arXiv:2609.14657,涉及分布式并行计算与人工智能交叉领域研究arXiv
  • arXiv:2609.15562《PIVOT: Physics-Grounded Verification for AI-Generated Audio-Video Detection》,提出基于物理规则的AI生成音视频检测验证方法arXiv
  • arXiv:2609.09157,聚焦机器人领域与人工智能交叉的具身任务相关研究arXiv

多模态

厂商动态

  • 字节跳动豆包:升级Seed 2.1 Pro-0915版本,重点强化多模态编程能力,在大型代码仓库处理、复杂工程问题解决、3D建模与端到端开发等方面实现能力跃升,适配企业级生产场景需求新华网
  • 紫东太初:开源的ZDTaichu5.0-9B模型同时属于多模态领域重点进展,支持多类型视觉输入,强化空间理解与具身任务能力上海证券报
  • 奇富科技:在2026年服贸会分享统一多模态大模型底座在金融业务中的落地实践,推动金融场景AI Native转型中国经济网
  • OpenAI:多模态推理技术实现突破,“图像思考”能力实现视觉与文本推理无缝融合,在多模态基准测试中获得顶尖成绩,支持用户通过拍照提问,适配复杂物理场景识别需求OpenAI官网

arXiv论文

  • arXiv:2609.09924《Multimodal Emotion Recognition in Conversations》,聚焦对话场景下的多模态情感识别研究arXiv
  • arXiv:2609.18057《Anchoring What Matters: A Dual-Level Learning Framework for Visually-》,提出面向视觉任务的双层学习框架,提升多模态模型关键信息锚定能力arXiv
  • arXiv:2608.26317《Modality Maturity Index: A benchmark for assessing multimodal capabilities of omni models》,提出全模态模型多模态能力评估基准Modality Maturity IndexarXiv

Omni 全模态

厂商动态

  • 阿里千问:正式上线新一代原生全模态模型Qwen3.8-Omni-Flash,支持文本、图像、音频、视频多类型输入,上下文长度达1M。相比上一代Qwen3.5-Omni-Plus,全模态能力平均提升超25%,音频输入成本每小时下降98%以上,音视频综合输入成本每小时下降93%以上;具备音视频Agentic能力,可完成视频剪辑、MV创作、影视解说、音视频转图文摘要等任务,同时支持任务规划、工具调用与创作交付,目前已在千问AI平台开放使用IT之家千问大模型微博
  • NVIDIA:推出Nemotron 3 Nano Omni 30B全模态模型,统一支持视频、音频、图像、文本理解,适配企业级问答、摘要、转录等场景NVIDIA NIM
  • Google DeepMind:Gemini Omni全模态模型支持高分辨率视频生成与编辑,可通过自然对话实现视频内容修改Google DeepMind

arXiv论文

  • arXiv:2609.18323《Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model》,针对MiniMax-H3全模态生成模型的物理世界推理能力开展系统性评估arXiv
  • arXiv:2609.08977《Omni Interaction Agent Technical Report》,提出全模态交互智能体技术方案,覆盖多模态感知、智能体编排等核心模块arXiv
  • arXiv:2607.15686《S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation》,提出面向科学领域的统一多模态推理模型S1-Omni,支持科学内容的理解、预测与生成arXiv

具身智能

厂商动态

  • 中国移动研究院:在2026服贸会正式发布“弈衡”三位一体全链路具身智能评测体系及平台,同步展出自主研发的具身智能全栈式评测一体机,推出《“弈衡”具身智能评测体系白皮书》等系列成果,完善具身智能产业评测标准新浪财经
  • 行业动向:国家数据局召开首场具身智能专项座谈会,产业落地加速推进,2026 InnoMatch技术转移大会上具身智能技术已在特种作业、智能康复等真实产业场景落地应用《中国经济周刊》头条
  • 汽车与具身智能融合加速:车百会研究院指出,汽车产业技术链与具身智能产业融合将大幅缩短具身智能产业化周期,小鹏等企业已布局具身智能机器人研发中国工信新闻网
  • Google DeepMind:推出Gemini Robotics 2视觉-语言-动作(VLA)模型,可将视觉与语言输入转换为机器人全身控制指令,实现机器人全身智能Google DeepMind

arXiv论文

  • arXiv:2609.16697《World Models for Embodied Intelligence: From Plausible to Controllable to Actionable》,梳理具身智能世界模型的技术演进路径,从合理性、可控性、可执行性三个维度提出优化方向arXiv
  • arXiv:2609.16683《Weave: Learning Whole-Body Dexterous Loco-Manipulation from Human-Object Interactions》,提出从人与物体交互数据中学习机器人全身灵巧操作能力的方法WeavearXiv
  • arXiv:2608.16794《NEUROSYMBOLIC EMBODIED AGENTS A PREPRINT》,提出面向长周期家庭任务的神经符号具身智能体架构arXiv

本周趋势观察

本周AI领域呈现三大明确趋势:一是大模型迭代进入“性能+成本”双优化阶段,海内外厂商密集发布旗舰模型的同时,开始针对性推出轻量级、低激活参数的细分场景模型,全栈国产大模型落地进程明显加快;二是全模态模型从“理解能力”向“执行能力”跃迁,Qwen3.8-Omni-Flash等新品在成本大幅下降的基础上,强化了音视频场景的任务规划与工具调用能力,全模态Agent的商用门槛显著降低;三是具身智能产业进入标准化落地期,国家层面政策引导、评测体系发布、场景落地案例增多,同时汽车产业与具身智能的技术链融合开始显现,将成为下一个产业落地重要方向。此外大模型迭代带动的算力硬件需求持续升温,AI硬件产业链的市场关注度预计将保持高位。

评论