今日速览
- 亮源新创发布全身智能基础模型Light-O1,首次验证人类全身动作预训练跨本体迁移规律,10万小时动作训练数据可迁移至机器人。
- 启元发布Q1、T1两款消费级个人机器人并同步开售,接入腾讯WorkBuddy可调用上万种技能。
- 阿里千问Qwen3.8-Omni-Flash全模态模型上线,支持四模态输入、1M上下文,API成本最高降98%。
- 华为发布昇腾960超节点,算力卡支持最高4096卡,可匹配十万亿级模型训练推理需求。
- 长三角安全AI实验室发布星界、星驭、星鉴三大AI安全解决方案,覆盖内容安全、智能体安全等领域。
大模型
厂商动态
- 亮源新创发布全身智能基础模型Light-O1:9月21日正式发布,首次验证人类全身动作预训练的跨本体迁移扩展规律,基于10万小时人类动作视频训练,结合语言、视觉信息可迁移至机器人,突破遥操作数据瓶颈,开源Preview版本已上线。
- 512颗GPU、10万亿参数!阿里达摩院发布全球最大AI预训练模型:阿里达摩院公布多模态大模型M6参数规模跃迁至10万亿,为目前全球最大预训练模型,具备多任务通用能力。
- 稳准智能LimiX-2发布 结构化数据模型实现领先:联合清华崔鹏团队发布400M参数结构化数据大模型LimiX-2,在TabArena、BCCO、TALENT三个国际结构化数据基准中Elo分数均位列榜单前列,性能超过Google、SAP等厂商同类产品。
- 刚刚,Opus 5.5跨级偷袭,直扑GPT-6:Anthropic被曝正在内测Claude Opus 5.5,代号「claude-wafer-eap」,据传性能超过GPT-6 Astra,定价为百万Token输入4美元、输出2美元,最快本周二正式发布。
- OpenAI动态:推出全新AI广告体验,包含赞助智能体、营销工具,支持与HubSpot、Shopify集成;上线ChatGPT工作与Codex分析功能,可帮助企业关联AI使用情况与业务价值,核算AI投入产出。
arXiv论文
- arXiv:2609.19465:《Compositional R》(cs.LG领域)
- arXiv:2609.19144:提出大模型偏好对齐的零阶范式(cs.CL、cs.AI领域)
- arXiv:2609.20539:研究大模型并行性、临界窗口与能力分离问题(cs.RO领域)
AI 应用
厂商动态
- 阶跃星辰发布新一代旗舰基座模型Step 5 Preview:位列全球开源大模型前三,已开放第三方接口,将于10月15日开源完整权重,实现性能与成本的帕累托优化。
- 华为发布新一代AI算力基础设施昇腾960超节点:算力卡搭载上限从1024卡升级至4096卡,首次采用近封装光学(NPO)技术,可支持十万亿参数级模型的训练与推理需求;同期华为云上线灵衢昇腾950智算集群,推出Agentic MaaS平台,汇聚多类大模型适配行业智能体开发。
- 长三角安全人工智能实验室发布三大AI安全解决方案:星界、星驭、星鉴方案分别覆盖大模型内容安全、智能体应用安全、AIGC生成内容传播可信三个领域。
- Meta动态:发布Muse Image和Muse Video生成工具,已在Meta AI、Instagram Stories等产品上线;NLLB多语言翻译模型支持200种语言互译,覆盖多个低资源语种。
- Google DeepMind发布AlphaGenome Atlas:可预测90亿种人类DNA变异的分子影响,助力基因研究。
arXiv论文
- arXiv:2609.17414:研究连续时间语言智能体(cs.AI领域)
- arXiv:2609.19635:研究基于检查点切换的强化学习增益提升方法(cs.AI领域)
- arXiv:2609.20539相关医学智能体论文:医学Agentic AI研究,被MICCAI 2026相关Workshop接收。
多模态
厂商动态
- 中国首款藏语多语言全模态AI输入法“智达AI输入法”发布:由藏语智能全国重点实验室研发,覆盖全终端,支持文字、语音、图像多模态输入,可同步跨端词库与输入习惯。
- 智谱发布GLM-5.3-FlashX:推理速度提升至200 tokens/s,适配低延迟多模态交互场景。
- 智象未来提出AI视频产业新趋势:国内多模态AIGC已脱离单纯比拼画质、时长的阶段,竞争转向全链路系统能力,AI视频从生成素材向完整作品交付演进。
- 车载多模态交互落地加速:新浪新闻报道显示2026年车载语音助手装配量突破1100万辆,装配率达83%,小鹏第二代VLA模型推送首月智驾里程占比超50%,实现语音、视觉多模态指令融合执行。
- 乐享科技以太大模型机器人完成全球首次户外全自主直播:多台搭载以太大模型的机器人在户外连续自主作业1小时,完成点单、烧烤、上菜全流程任务协作。
arXiv论文
- arXiv:2609.09924:对话场景下的多模态情绪识别研究(cs.AI、cs.RO领域)
- arXiv:2609.08896:多模态问答技术演进研究,覆盖从模态自适应提取到统一语言表示的技术路径(cs.CL、cs.CV领域)
- arXiv:2609.03811:VisCAD多模态工业CAD基础模型套件发布,适配工业设计场景多模态理解需求。
Omni 全模态
厂商动态
- 阿里千问发布Qwen3.8-Omni-Flash全模态模型:支持文本、图像、音频、视频四模态输入,上下文窗口达100万Token,30项评测平均得分较上一代提升超26%,音视频理解能力显著增强,API成本最高降幅达98%,百万Token图文音视频输入仅需0.8元,已在千问AI平台开放使用;新增全链路音视频Agent能力,可自主完成长时音视频素材的内容理解、信息提炼、剪辑创作全流程任务,直接交付可用成片。
- Google DeepMind Gemini Omni模型更新:主打高分辨率视频生成与编辑能力,支持多模态输入输出统一处理。
- OpenAI GPT-4 Omni:支持音频、视觉、文本实时推理,为当前主流全模态基准模型。
- Meta Llama 4 Scout:原生多模态全模态模型,主打端侧部署的成本与性能平衡。
arXiv论文
- arXiv:2609.18323:针对MiniMax-H3全模态生成模型的物理世界推理能力评测研究
- arXiv:2609.16057:OmniHarness框架,通过符号策略学习提升通用视觉生成的泛化能力
- arXiv:2603.06577:Omni-Diffusion框架,实现基于掩码离散扩散的统一多模态理解与生成
具身智能
厂商动态
- 启元发布两款消费级个人机器人并正式开售:上纬新材旗下启元机器人发布Q1、T1两款C端具身智能产品,实现发售即发货;接入腾讯WorkBuddy,可直接调用平台上万种技能,覆盖日常家务、个性化服务等场景,成为首个接入WorkBuddy的具身智能企业。
- 我国首个具身智能数据要素跨境流通服务贸易平台发布:由北京石景山科创集团联合中国电信北京分公司共建,为国内首个聚焦具身智能数据跨境流通的行业级服务平台,助力具身智能数据合规跨境流动。
- Google DeepMind Gemini Robotics 2发布:为先进视觉-语言-动作(VLA)模型,可支持不同形态机器人的全身智能控制,适配多场景具身任务需求。
- Meta Habitat 3具身智能平台更新:主打社交智能机器人研究,支持机器人适配人类偏好,完成日常家务等协作任务。
arXiv论文
- arXiv:2609.16697:具身智能世界模型研究,梳理从合理预测到可控、可执行的技术演进路径
- arXiv:2609.16641:具身操作相关技术研究,包含8组实验验证动作控制精度提升效果
- arXiv:2508.15201:具身操作的视觉-语言-动作模型综述,梳理大模型驱动的机器人控制技术发展脉络
本周趋势观察
- 具身智能进入“落地爆发期”:上游基础模型层面亮源Light-O1验证了人类动作预训练到机器人迁移的技术路径,下游消费端启元机器人直接开售并接入通用技能生态,同时数据流通基础设施同步落地,产业从技术验证向规模化应用演进的链条已初步打通。
- 全模态模型从“理解”向“执行”升级:阿里Qwen3.8-Omni-Flash为代表的新模型跳出纯内容理解范畴,将Agent能力嵌入音视频全工作流,多模态大模型的生产力属性显著增强,直接适配内容生产、企业服务等场景的端到端需求。
- 大模型竞争向“垂直场景+成本优化”倾斜:结构化数据模型、小参数开源模型、低延迟推理版本密集发布,同时各家均大幅下调API定价,行业从单纯比拼参数规模转向场景适配性与投入产出比的综合竞争。
- AI基础设施与安全体系同步补全:华为昇腾960超节点支持十万亿级模型训练,三大AI安全解决方案覆盖从模型到应用的全链路风险,产业发展的支撑体系进一步完善。