今日速览
- 阿里发布Qwen3.8-Omni-Flash原生全模态模型,支持1M上下文,音视频理解能力大幅提升
- 乐享科技完成全球首次具身智能机器人1小时户外全自主直播,覆盖点单、烧烤全流程
- 移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统,为AI应用提供自主可控算力路径
- TypeSafe推出专注校准决策的Jev模型,输出token免费,可大幅降低幻觉风险
- 清华发布2026青年关注AI技术榜单,具身智能基础模型、多模态推理大模型等上榜
大模型
厂商动态
- 智能经济30人论坛 | 国内外AI大模型周报(总第12期)披露,Mistral AI完成30亿欧元融资,估值升至213亿欧元,由三星电子领投;OpenAI万级智能体历时88小时给出纳维—斯托克斯千禧年难题解答,同时发布ChatGPT Images 2.5,生成延迟最多降低50%。
- 移动云发布国内首个国产GPU+类脑芯片大模型异构混合推理系统,该系统由移动云联合中国电子科技南湖研究院、灵汐科技、天数智芯等共同打造,通过全栈架构创新实现国产芯片对大模型推理的高效支撑,为大模型、多智能体应用提供自主可控算力路径。
- TypeSafe发布Jev模型,专注校准决策,该模型基于Transformer架构,直接输出概率实现「校准决策」,可避免幻觉,输出token免费,输入token按十亿量级计费,速度和成本优势明显;创始人迪奥戈·阿尔梅达曾参与ChatGPT构建,为RLHF技术发明者。
- 史上最大IPO,或推迟!消息显示,Anthropic为应对OpenAI GPT-6 Astra的竞争,正考虑推出全新AI模型,IPO计划或推迟至美国11月中期选举之后,此前市场预期估值可达2万亿美元。
- OpenAI官方页面显示GPT-5已于2025年8月推出,目前最新模型为GPT-6,同时推出GPT-Live-1 API支持自然语音交互构建。
arXiv动态
今日暂未捕获到大模型方向新增的高相关前沿论文。
AI 应用
厂商动态
- 网易有道AI Open Day发布LobsterAI 2.0及多场景Agent生态,覆盖办公、学习、营销等多场景的AI Agent产品矩阵,开源办公Agent成为行业新变量。
- 华为云亮出企业级AI产品矩阵,灵衢昇腾950智算集群服务将于9月30日国内商用、11月30日海外商用;企业级智能体平台智果AgentArts及开源版openJiuwen已服务100多家企业,预计12月30日正式商用。
- Meta发布Muse Image和Muse Video生成工具,Muse Image已在Meta AI app、meta.ai、美国Instagram Stories及部分国家WhatsApp上线,后续将推广至Facebook。
- Google DeepMind推出手语转文本(SL2T)模型,可实现手语的实时识别转写,助力听障人群交流;同时发布AlphaGenome Atlas,可预测90亿种人类DNA变异的分子影响。
- OpenAI推出面向金融行业的解决方案,基于GPT-6 Astra整合金融数据与专项工具,可提升金融团队研究、分析、运营及客户服务效率。
arXiv动态
- arXiv:2609.18063 The Other Half of the Memory Wall: Serving 35B MoEs,聚焦大模型推理服务中的内存墙问题,探索35B参数MoE模型的高效服务方案。
- arXiv:2609.19531 Detecting Soft Errors in Parallel Software with LLM-tuned Ins,提出基于大模型调优的并行软件软错误检测方法,提升分布式系统可靠性。
多模态
厂商动态
- 智象未来发布原生全模态视频生成模型HiDream-O1-Video-1.0,是其HiDream-O1原生全模态世界模型架构的系列成果,可实现高保真视频生成。
- Meta Llama 4系列模型具备原生多模态能力,支持近无限上下文窗口,可适配不同规模的部署需求。
- Mistral AI作为NVIDIA Nemotron联盟创始成员,将贡献其多模态训练技术与企业级微调工具,加速开源前沿模型研发。
arXiv动态
- arXiv:2608.26317 Modality Maturity Index: A benchmark for assessing multimodal capabilities of omni models,提出模态成熟度指数,为全模态模型的多模态能力评估提供基准。
- arXiv:2609.17524 Modality-Autoregressive World-Action Models,提出共享世界动作骨干架构,通过扩散Transformer处理多模态token,提升世界模型的多模态交互能力。
Omni 全模态
厂商动态
- 阿里发布Qwen3.8-Omni-Flash原生全模态模型,支持文本、图像、音频、视频多类型输入,具备1M上下文能力,在保持同尺寸文本模型能力的同时,全模态评测平均得分较上一代显著提升,配套API成本较此前降低九成,已在千问AI平台上线。该模型可支持超过10小时音频理解、400秒720P音视频理解,支持60+种语言音频输入、30+语言语音输出。
- Google DeepMind推出Gemini Omni视频生成编辑模型,支持通过自然对话实现视频的编辑与创作,具备高分辨率视频生成能力。
- OpenAI GPT-4 Omni支持音频、视觉、文本的实时推理,是其全模态旗舰模型。
arXiv动态
- arXiv:2609.18323 Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model,对MiniMax-H3全模态生成模型的物理世界推理能力进行了系统性评估。
- arXiv:2607.15686 S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation,提出面向科学领域的统一多模态推理模型S1-Omni,支持科学内容的理解、预测与生成。
具身智能
厂商动态
- 苏州吴中:全球首次!乐享科技完成户外机器人全自主直播,搭载以太大模型的多台机器人在真实户外开放环境中,连续1小时自主完成点单、任务规划、烧烤、上菜全流程,550万网友在线见证,是全球首次具身智能大模型长时户外全自主直播,验证了主动感知、多模态理解、流式记忆等核心能力在复杂场景的稳定性。
- 清华发布青年最关注的AI技术,具身智能基础模型等上榜,在2026清华人工智能青年大会上,由4000名全球青年票选的《2026年青年最关注的改变未来五大AI技术榜单》揭晓,具身智能基础模型、多模态推理与生成大模型、可交互世界模型等入选。
- 中国移动研究院发布“弈衡”三位一体全链路具身智能评测体系及平台,同步推出配套白皮书与全栈式评测一体机,形成完整的具身智能评测能力。
- Google DeepMind Gemini Robotics 2是最新的视觉-语言-动作(VLA)模型,可将视觉和语言输入转换为机器人动作指令,为各类机器人提供全身智能支持。
arXiv动态
- arXiv:2609.19659 EmbodiedMind: Adaptive Data Curation and Prefix-Tree Reinforcement Learning for Efficient Embodied Intelligence,提出自适应数据 curation 与前缀树强化学习框架,提升具身智能的学习效率与场景泛化能力。
- arXiv:2609.18326相关研究聚焦具身智能的推理决策优化,相关成果已被EMNLP 2026接收。
本周趋势观察
本周行业呈现三大明确趋势:一是全模态模型从“能力覆盖”向“成本优化”落地,Qwen3.8-Omni-Flash将音视频Agent成本降低九成,标志着全模态能力开始从实验室走向规模化商用;二是具身智能进入“真实场景验证”阶段,户外全自主直播的完成打破了此前具身智能仅能在实验室可控环境运行的认知,产业落地节奏明显加快;三是自主可控算力体系逐步完善,国产GPU+类脑芯片异构推理系统的发布,为国内大模型与AI应用的发展提供了底层算力保障,将进一步降低本土AI产业的供应链风险。同时决策专用模型的出现也体现了大模型赛道的垂直化分工趋势,通用模型之外,面向特定场景优化的专用模型将成为重要的行业分支。