今日速览
- 阿里巴巴推出新一代原生全模态模型Qwen3.8-Omni-Flash,支持文本、图像、音频、视频输入及1M上下文,音视频Agent成本下降九成。
- 移动云联合多家机构发布国内首个国产GPU+类脑芯片大模型异构混合推理系统,为国产算力支撑大模型推理提供新路径。
- 紫东太初开源ZDTaichu5.0-9B通用多模态大模型,为10B参数内空间具身能力最强模型,同时公开数据生产方案。
- TypeSafe推出专注校准决策的Jev模型,输出token免费,可有效降低幻觉,创始人为RLHF技术发明者。
- 清华发布青年最关注AI技术榜单,具身智能基础模型、多模态推理与生成大模型等技术上榜。
大模型
厂商动态
- 移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统:2026中国算力大会上,移动云联合中国电子科技南湖研究院、灵汐科技、天数智芯、清华、北大等机构正式发布该系统,通过全栈架构创新实现国产芯片对大模型推理的高效支撑,为大模型、多智能体应用提供自主可控算力路径。
- TypeSafe发布Jev模型,专注校准决策:由RLHF发明者、前OpenAI成员迪奥戈·阿尔梅达创办的TypeSafeAI推出该模型,区别于传统大语言模型直接输出概率实现「校准决策」,输出token免费,输入按十亿token量级计费,速度与成本优势显著,可有效避免幻觉。
- Anthropic拟推新模型应对GPT-6 Astra竞争,IPO或推迟至11月中期选举后:路透社18日援引知情人士消息,Anthropic正筹备全新AI模型以应对OpenAI最新产品竞争,原计划10月中旬开启路演的IPO进程或将推迟。
- 智能经济30人论坛 | 国内外AI大模型周报(总第12期):披露9月7日-13日国际大模型动态,包括Mistral AI完成30亿欧元融资估值升至213亿欧元(三星领投)、OpenAI万级智能体历时88小时给出纳维-斯托克斯千禧年难题解答、OpenAI发布ChatGPT Images 2.5生成延迟最高降低50%。
- OpenAI官网显示GPT-5已于2025年8月发布,当前最新模型为GPT-6,同时推出支持自然语音交互的GPT-Live-1 API。
arXiv动态
当日未捕获到大模型领域新增的高相关独立论文成果,相关研究可参考跨领域通用技术论文。
AI 应用
厂商动态
- 华为云发布企业级AI产品矩阵:华为全联接大会2026上,华为云CEO周跃峰公布:灵衢昇腾950智算集群服务9月30日国内商用、11月30日海外商用;企业级智能体平台智果AgentArts及开源版openJiuwen已服务100余家企业,智果AgentArts将于12月30日正式发布。
- 网易有道发布LobsterAI 2.0及多场景Agent生态:9月16日有道AI Open Day上,公司集中展示覆盖办公、学习、营销等场景的AI Agent产品矩阵,开源办公Agent成为核心亮点。
- OpenAI推出金融服务解决方案:集成GPT-6 Astra与金融领域数据,配套专用工具提升金融团队研究、分析、运营及客户服务效率。
- Meta推出Muse Image、Muse Video生成工具:Muse Image已在美国Meta AI app、meta.ai、Instagram Stories及部分国家WhatsApp上线,后续将扩展至Facebook。
arXiv动态
- arXiv:2609.18063 The Other Half of the Memory Wall: Serving 35B MoEs:针对35B参数混合专家模型的推理服务内存墙问题提出优化方案,可提升大模型部署效率。
- arXiv:2609.19531 Detecting Soft Errors in Parallel Software with LLM-tuned Ins:提出基于大模型调优的并行软件软错误检测方法,提升分布式系统可靠性。
多模态
厂商动态
- 紫东太初开源ZDTaichu5.0-9B通用多模态大模型:9月15日正式开源该模型,参数规模9B,为10B参数内空间具身能力最强的通用多模态模型,通用能力处于第一梯队;本次不仅开放权重,还公开数据生产详细方案,已在科研自动化、智能制造实体场景完成验证。
- 智象未来提出AI视频向完整作品交付演进:服贸会AIGC创新应用交流会上,智象未来COO王科表示,国内多模态AIGC行业已告别单纯比拼画质、时长的阶段,技术竞争转向全链路系统能力,AI视频正从生成素材向完整作品交付升级。
- 琶洲实验室推出多模态脑机AI轮椅:2026广东省科普创新展上亮相的该系统,可通过脑机接口实时采集用户脑电信号,转化为前进、后退、旋转等控制指令,为特殊人群提供更便捷的移动支持。
arXiv动态
- arXiv:2609.17524 Modality-Autoregressive World-Action Models:提出基于扩散Transformer的多模态世界-动作统一建模框架,可处理多种模态输入并生成动作序列,为多模态交互系统提供技术支撑。
- arXiv:2608.26317 Modality Maturity Index: A benchmark for assessing multimodal capabilities of omni models:提出全模态模型多模态能力评估基准Modality Maturity Index,可量化衡量不同模型的多模态理解与生成能力。
Omni 全模态
厂商动态
- 阿里发布Qwen3.8-Omni-Flash原生全模态模型:9月18日千问AI平台正式上线该模型,可同时处理文本、图像、音频、视频输入,支持1M token上下文;在保持同尺寸纯文本模型能力的基础上,全模态能力较上一代显著提升,配套Realtime API将音视频Agent成本降低九成,支持超过10小时音频理解、400秒720P音视频理解,覆盖60+种语言音频输入、30+种语言语音输出。
- Google DeepMind Gemini Omni支持高分辨率视频生成与编辑,可通过自然对话实现视频修改创作。
- Meta Llama 4系列模型内置原生多模态能力,支持接近无限长度上下文窗口,适配大规模场景部署。
arXiv动态
- arXiv:2609.18323 Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model:针对MiniMax-H3全模态生成模型的物理世界推理能力展开系统性评估,量化了当前全模态模型在常识物理推理任务上的表现与不足。
- arXiv:2608.10720v2 Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence:提出具备原生视觉呈现能力的高表现力全模态对话模型,可实现图文音多模态自然交互。
具身智能
厂商动态
- 苏州乐享科技完成全球首次户外机器人全自主直播:搭载以太大模型的多台机器人在真实开放户外环境中,连续1小时自主完成点单、任务规划、烧烤、上菜全流程,线上观看量超550万,验证了具身智能在非受控场景下的长时稳定作业能力。
- 清华发布青年最关注AI技术榜单,具身智能基础模型上榜:9月19日2026清华人工智能青年大会上,由4000名全球青年票选的榜单揭晓,多模态推理与生成大模型、可交互世界模型、具身智能基础模型等五大技术入选。
- 中国移动研究院发布“弈衡”具身智能评测体系:服贸会上正式发布该三位一体全链路评测体系及平台,同步展出具身智能全栈式评测一体机,推出两份相关白皮书,形成完整的具身智能评测能力。
- Google DeepMind推出Gemini Robotics 2视觉-语言-动作模型,可将视觉和语言输入转化为机器人全身控制指令,为不同类型机器人提供通用智能层。
arXiv动态
- arXiv:2609.16697 World Models for Embodied Intelligence: From Plausible to Controllable to Actionable:梳理具身智能世界模型的技术演进路径,提出从合理性生成到可控性再到可执行性的三阶发展框架,为世界模型在具身场景的落地提供指导。
- arXiv:2609.19659 EmbodiedMind: Adaptive Data Curation and Prefix-Tree Reinforcement Learning for Efficient Embodied Intelligence:提出自适应数据筛选与前缀树强化学习结合的具身智能训练方法,可大幅提升机器人在复杂场景下的学习效率与泛化能力。
本周趋势观察
本周AI领域呈现三条明确的演进主线:一是全模态模型从能力堆叠走向成本普惠,阿里Qwen3.8-Omni-Flash将音视频Agent成本降低九成,标志着全模态能力从少数高端场景开始向大众应用普及,1M上下文+多模态统一处理的架构逐渐成为行业标配。二是国产算力自主可控路径进一步清晰,移动云国产GPU+类脑芯片异构推理系统的发布,验证了混合架构支撑大模型推理的可行性,为解决大模型规模化落地的算力卡脖子问题提供了新的技术选项。三是具身智能加速从实验室走向真实场景,户外全自主直播、行业级评测体系发布、底层模型训练方法突破同步出现,叠加行业融资上半年突破900亿元,具身智能的工程化落地节奏明显加快,2026年下半年有望在工业、服务业场景出现首批规模化商用案例。