Back

AI 每日调研 · 2026年09月16日|GPT-6 Sol待发、AI智能体手机落地、Vidu S2发布

AI 每日调研 · 2026年09月16日

今日速览

  1. 大模型领域头部厂商密集迭代:OpenAI 9月已推出GPT-Live-1、GPT-6 Astra,o1系列推理模型与200美元/月的ChatGPT Pro套餐同步公布;生数科技发布Vidu S2实时互动与视频编辑双模型,全量开放体验。
  2. AI 应用落地迎来多项标志性进展:全球首个商用AI智能体手机于9月16日正式落地;《人工智能安全治理框架3.0》发布,进一步完善行业规范;OpenAI GPT-6 Sol被曝内部测试,预计本月正式发布。
  3. 多模态技术加速场景渗透:豆包Seed 2.1 Pro升级多模态编程能力,覆盖大型代码仓库处理、3D建模等场景;智象未来发布原生全模态视频生成模型HiDream-O1-Video-1.0,登顶两项国际权威评测。
  4. 具身智能产业落地进程加快:紫东太初开源ZDTaichu5.0-9B具身大脑,拿下8项同参数全球基准测试第一;国内已建成超70家具身智能训练场,支撑技术从实验室走向产业端;中科院团队自研Maxwell具身大模型登顶Meta-World评测榜首。
  5. 行业治理与基础设施同步推进:国家数据局召开首场具身智能专项座谈会,引导产业规范发展;算力网络、AI训练场等新型基础设施建设持续提速,为AI规模化应用提供支撑。

大模型

厂商动态

  1. OpenAI
    • 9月公布多项产品更新:API上线GPT-Live-1,支持全双工自然语音对话、指令跟随、自定义音色与电话接入能力;正式发布GPT-6 Astra,定位面向工作场景的下一代智能模型;推出o1系列推理模型,核心特性为推理阶段增加思考时间,提升复杂问题解决能力。
    • 会员体系新增ChatGPT Pro套餐,定价200美元/月,匹配高算力消耗的高级推理功能。
    • 内部测试信息显示GPT-6 Sol已在API中被发现,预计本月正式发布,官方预告本周将有重大更新,力度达2025年DevDay预期水平。
  2. Anthropic
    • 9月1日发布Claude Fable 5.1与Mythos 5.1,核心特性为性能翻倍、使用成本大幅下降,重点解决企业级数据合规痛点来源
  3. 国内厂商动态
    • 生数科技9月16日发布Vidu S2双模型,包含S2-Avatar实时互动模型与S2-Editing视频编辑模型,支持空间视频转换,发布当日即全量开放在线体验。
    • 行业进入十万卡训练规模阶段,三季度国内外厂商密集发布旗舰模型,头部企业同时开始关注训练成本与投入产出比平衡来源

arXiv 论文

  1. Dynamic Semantic Compression for Efficient Latent-Space Inference(arXiv:2609.15338):针对大模型推理效率问题,提出动态语义压缩方法,优化隐空间推理过程。
  2. The information geometry of large language models is shared, learned, and controllable:揭示大模型的信息几何特性具备通用性、可学习性与可调控性,为模型架构优化与对齐提供理论支撑。

AI 应用

厂商动态

  1. 消费级应用
    • 全球首个商用AI智能体手机于9月16日正式落地,支持实景理解、自动跨应用操作,例如用户拍摄实景后可自动完成电商商品检索、比对与推荐,标志AI手机从“内置大模型”阶段进入“智能体原生交互”阶段。
  2. 行业赋能
    • 2026中国算力大会上,华为展示七大板块AI行业赋能方案,覆盖算力基础设施、鸿蒙终端AI能力、垂直行业场景落地等方向来源
    • 上海创智学院集中发布9项AI前沿成果,包括自进化科研驾驶舱(服务十余个科学家团队,覆盖千万级文献)、AI辅助材料筛选(水系电池材料研发周期从6个月压缩至数小时)、通用世界模型(国际开源平台下载量超280万)来源
  3. 治理规范
    • 2026年国家网络安全宣传周上,全国网络安全标准化技术委员会发布《人工智能安全治理框架3.0》,在1.0、2.0版本基础上进一步完善安全治理要求,对接《全球人工智能治理倡议》。
  4. 海外厂商动态
    • Meta 推出Muse Image与Muse Video多模态生成工具,现已上线Meta AI app、meta.ai、美国区Instagram Stories,部分国家WhatsApp已接入相关能力。
    • Google DeepMind 发布AlphaGenome Atlas,可预测90亿种人类DNA变异的分子影响,为基因研究与疾病治疗提供AI支撑。

arXiv 论文

  1. Beyond "ChatGPT Can Make Mistakes": Designing Interventions to Support Metacognitive Monitoring in AI-Assisted Work:针对AI辅助工作场景下的错误风险,设计元认知监控干预方案,提升人机协作可靠性。

多模态

厂商动态

  1. 国内厂商进展
    • 字节跳动豆包大模型9月16日升级Seed 2.1 Pro-0915版本,重点强化多模态编程能力,支持大型代码仓库处理、复杂工程问题解决、3D建模与端到端开发,推动AI编程从演示场景走向企业级生产落地。
    • 智象未来9月15日发布HiDream-O1-Video-1.0原生全模态视频生成模型,为物理规律导向架构,发布同期登顶两项国际权威视频生成评测榜单来源
    • 商汤发布“日日新SenseNova V6”,从底层重构多模态架构,实现文本、图像、视频端到端融合,聚焦强推理、强交互、长记忆三大能力突破。
    • 多态云脑申请“基于多模态模型的数字内容生产方法及系统”专利,可提升数字内容生产效率、输出质量与跨平台适配能力来源
  2. 海外厂商进展
    • OpenAI 多模态推理能力实现突破,图像思考功能支持视觉与文本推理无缝融合,可直接处理模糊、倒置、多对象的复杂图像输入,在多模态基准测试中达到顶尖水平。
    • Mistral AI 与NVIDIA达成合作,将贡献多模态能力与企业级微调工具,加速开源前沿模型落地来源

arXiv 论文

  1. VoT: Vision-of-Thought for Unified Multimodal Representation Alignment(arXiv:2609.07815):提出视觉思维(VoT)框架,实现统一多模态表示对齐,提升跨模态理解精度。
  2. Multimodal Floorplan Encoding: Learning Dense Modality-Invariant Representations(ECCV 2026收录):提出多模态户型图编码方法,学习稠密的模态不变表示,可应用于建筑设计、家居智能等场景。
  3. LumiNote: LLM-Assisted Multimodal Instruction for VR Stage Lighting Education(arXiv:2609.17335):将大模型辅助的多模态指令应用于VR舞台灯光教学,探索多模态技术在教育场景的落地路径。

具身智能

厂商与产业动态

  1. 政策与基础设施
    • 国家数据局召开首场具身智能专项座谈会,引导产业规范发展与资源统筹来源
    • 国内已有超70家“机器人学校”(具身智能训练场)建成启用,支持机器人动作数据采集、训练与迭代,成为技术从实验室走向产业的关键基础设施来源
  2. 技术与产品发布
    • 武汉人工智能研究院紫东太初ZDTaichu5.0-9B具身大脑开源,在10B参数内空间能力评测登顶,同步公开覆盖预训练、微调、强化学习全环节的空间多模态数据生产管线,支持科研与产业端复用来源,该模型横扫九大国际权威空间基准,拿下8项同参数通用组别全球第一来源
    • 中国科学院工业人工智能研究所自研Maxwell具身智能大模型登顶Meta-World评测榜首,模型融合文字、图像、代码、状态、动作5个模态,支持复杂任务指令理解与执行。
    • 乐享科技预告全球首次机器人户外直播,将用以太大模型零样本挑战烧烤任务,模型具备主动感知、原生多模态理解等核心能力,可适配户外复杂环境来源
    • 2026服贸会集中展示多款具身智能机器人,已具备环境感知、自主决策能力,开始从实验室走向物流、服务等真实场景来源
  3. 海外厂商进展
    • Google DeepMind 发布Gemini Robotics 2视觉-语言-动作(VLA)模型,可实现机器人全身智能控制,适配不同类型机器人的任务需求。
    • Mistral AI 推出Robostral Navigate机器人导航模型,可跨机器人类型泛化,适应训练中未见过的真实世界障碍物。

arXiv 论文

  1. World Models for Embodied Intelligence: From Plausible to Controllable to Actionable(arXiv:2609.16697):提出具身智能世界模型的三层演进路径,从合理性生成到可控性、可执行性升级,明确几何、物理、动作三个核心维度的建模方向。
  2. Neurosymbolic Embodied Agents(arXiv:2608.16794v2):提出神经符号具身智能体架构,结合神经网络感知能力与符号逻辑推理能力,提升复杂场景下的任务执行可靠性。

本周趋势观察

  1. 大模型竞争从参数规模转向“能力-成本”平衡:三季度头部厂商密集发布旗舰模型的同时,普遍将成本下降、推理效率提升作为核心卖点,叠加行业对十万卡级训练投入的理性反思,标志大模型产业从“堆资源冲性能”阶段进入“性价比优化”阶段,企业级场景落地成为核心竞争焦点。
  2. 多模态技术向“垂直场景深度渗透”演进:本周多模态更新不再局限于通用文生图、文生视频效果提升,而是针对性强化编程、工业设计、数字内容生产等垂直场景能力,技术落地从“通用能力演示”转向“生产工具替代”,工程化适配成为核心壁垒。
  3. 具身智能产业进入“开源+基础设施”双轮驱动阶段:紫东太初等开源具身模型降低了技术准入门槛,而超70家训练场的建成则解决了数据供给痛点,叠加政策层面的专项引导,具身智能有望在1-2年内实现物流、工业制造等场景的规模化商用。
  4. AI安全治理与技术发展同步推进:《人工智能安全治理框架3.0》的发布,对应大模型推理能力、具身智能自主性提升带来的新风险,治理体系的完善将为AI技术落地提供更清晰的合规边界,长期利好产业健康发展。

评论