Back

AI 每日调研 · 2026年09月21日|亮源发全身智能模型、启元消费级机器人开售、阿里全模态模型升级

今日速览

  1. 亮源新创发布全身智能基础模型Light-O1,首次验证人类全身动作预训练跨本体迁移规律,10万小时动作训练数据可迁移至机器人。
  2. 启元发布Q1、T1两款消费级个人机器人并同步开售,接入腾讯WorkBuddy可调用上万种技能。
  3. 阿里千问Qwen3.8-Omni-Flash全模态模型上线,支持四模态输入、1M上下文,API成本最高降98%。
  4. 华为发布昇腾960超节点,算力卡支持最高4096卡,可匹配十万亿级模型训练推理需求。
  5. 长三角安全AI实验室发布星界、星驭、星鉴三大AI安全解决方案,覆盖内容安全、智能体安全等领域。

大模型

厂商动态

  • 亮源新创发布全身智能基础模型Light-O1:9月21日正式发布,首次验证人类全身动作预训练的跨本体迁移扩展规律,基于10万小时人类动作视频训练,结合语言、视觉信息可迁移至机器人,突破遥操作数据瓶颈,开源Preview版本已上线。
  • 512颗GPU、10万亿参数!阿里达摩院发布全球最大AI预训练模型:阿里达摩院公布多模态大模型M6参数规模跃迁至10万亿,为目前全球最大预训练模型,具备多任务通用能力。
  • 稳准智能LimiX-2发布 结构化数据模型实现领先:联合清华崔鹏团队发布400M参数结构化数据大模型LimiX-2,在TabArena、BCCO、TALENT三个国际结构化数据基准中Elo分数均位列榜单前列,性能超过Google、SAP等厂商同类产品。
  • 刚刚,Opus 5.5跨级偷袭,直扑GPT-6:Anthropic被曝正在内测Claude Opus 5.5,代号「claude-wafer-eap」,据传性能超过GPT-6 Astra,定价为百万Token输入4美元、输出2美元,最快本周二正式发布。
  • OpenAI动态:推出全新AI广告体验,包含赞助智能体、营销工具,支持与HubSpot、Shopify集成;上线ChatGPT工作与Codex分析功能,可帮助企业关联AI使用情况与业务价值,核算AI投入产出。

arXiv论文

  • arXiv:2609.19465:《Compositional R》(cs.LG领域)
  • arXiv:2609.19144:提出大模型偏好对齐的零阶范式(cs.CL、cs.AI领域)
  • arXiv:2609.20539:研究大模型并行性、临界窗口与能力分离问题(cs.RO领域)

AI 应用

厂商动态

arXiv论文

多模态

厂商动态

arXiv论文

  • arXiv:2609.09924:对话场景下的多模态情绪识别研究(cs.AI、cs.RO领域)
  • arXiv:2609.08896:多模态问答技术演进研究,覆盖从模态自适应提取到统一语言表示的技术路径(cs.CL、cs.CV领域)
  • arXiv:2609.03811:VisCAD多模态工业CAD基础模型套件发布,适配工业设计场景多模态理解需求。

Omni 全模态

厂商动态

  • 阿里千问发布Qwen3.8-Omni-Flash全模态模型:支持文本、图像、音频、视频四模态输入,上下文窗口达100万Token,30项评测平均得分较上一代提升超26%,音视频理解能力显著增强,API成本最高降幅达98%,百万Token图文音视频输入仅需0.8元,已在千问AI平台开放使用;新增全链路音视频Agent能力,可自主完成长时音视频素材的内容理解、信息提炼、剪辑创作全流程任务,直接交付可用成片。
  • Google DeepMind Gemini Omni模型更新:主打高分辨率视频生成与编辑能力,支持多模态输入输出统一处理。
  • OpenAI GPT-4 Omni:支持音频、视觉、文本实时推理,为当前主流全模态基准模型。
  • Meta Llama 4 Scout:原生多模态全模态模型,主打端侧部署的成本与性能平衡。

arXiv论文

  • arXiv:2609.18323:针对MiniMax-H3全模态生成模型的物理世界推理能力评测研究
  • arXiv:2609.16057:OmniHarness框架,通过符号策略学习提升通用视觉生成的泛化能力
  • arXiv:2603.06577:Omni-Diffusion框架,实现基于掩码离散扩散的统一多模态理解与生成

具身智能

厂商动态

arXiv论文

  • arXiv:2609.16697:具身智能世界模型研究,梳理从合理预测到可控、可执行的技术演进路径
  • arXiv:2609.16641:具身操作相关技术研究,包含8组实验验证动作控制精度提升效果
  • arXiv:2508.15201:具身操作的视觉-语言-动作模型综述,梳理大模型驱动的机器人控制技术发展脉络

本周趋势观察

  1. 具身智能进入“落地爆发期”:上游基础模型层面亮源Light-O1验证了人类动作预训练到机器人迁移的技术路径,下游消费端启元机器人直接开售并接入通用技能生态,同时数据流通基础设施同步落地,产业从技术验证向规模化应用演进的链条已初步打通。
  2. 全模态模型从“理解”向“执行”升级:阿里Qwen3.8-Omni-Flash为代表的新模型跳出纯内容理解范畴,将Agent能力嵌入音视频全工作流,多模态大模型的生产力属性显著增强,直接适配内容生产、企业服务等场景的端到端需求。
  3. 大模型竞争向“垂直场景+成本优化”倾斜:结构化数据模型、小参数开源模型、低延迟推理版本密集发布,同时各家均大幅下调API定价,行业从单纯比拼参数规模转向场景适配性与投入产出比的综合竞争。
  4. AI基础设施与安全体系同步补全:华为昇腾960超节点支持十万亿级模型训练,三大AI安全解决方案覆盖从模型到应用的全链路风险,产业发展的支撑体系进一步完善。

评论