今日速览
- 谷歌发布新一代旗舰大模型Gemini 4 Argon,优先向专业安全人员开放测试
- 中科院紫东太初开源ZDTaichu5.0-9B多模态大模型,9项国际基准拿8项第一
- 微软发布通用多模态基础模型BEiT-3,推动多模态预训练技术统一
- 具身智能领域新增Agent自提升、VLA工程平台方向arXiv研究成果
- 全模态领域暂无当日新增厂商动态,学术研究聚焦物理世界推理能力优化
大模型
厂商动态
- 谷歌发布Gemini 4 Argon大模型:10月3日谷歌发布新一代旗舰大模型Gemini 4 Argon,采取受控分阶段上线策略,暂不向普通用户开放,优先面向经过筛选的专业网络安全人员测试。该模型重点强化长周期任务推理、软件工程、企业知识处理与网络安全防御能力,输出Token上限由上一代的6.4万提升至100万。
- 其余厂商动态如OpenAI GPT-6.1 Sol、小米MiMo-V2.6系列、MiniMax 3发布预告等近5天已充分报道,当日无新增信息,暂不展开。
arXiv论文
- 当日无新增未报道的大模型方向学术成果,相关研究延续此前层级连续扩散语言模型、JIT-Agent框架等方向。
AI应用
厂商动态
- 当日无新增未报道的AI应用厂商动态,此前报道的我国生成式AI用户破7亿、智能体产业落地加速等趋势延续。
arXiv论文
- 暂未捕获到该方向当日新增未报道学术成果。
多模态
厂商动态
- 紫东太初开源ZDTaichu5.0-9B通用多模态大模型:中科院自动化所联合武汉人工智能研究院发布面向物理世界的通用多模态大模型ZDTaichu5.0-9B,参数约9B,支持单图、多图、长序列视频及任意分辨率视觉输入,在九大国际权威空间理解基准中拿下8项通用组别第一,是目前10B参数档位空间具身能力最强的通用多模态大模型。
- 微软发布通用多模态基础模型BEiT-3:BEiT-3实现文本、图像、多模态预训练技术架构统一,推动不同模态基础模型技术收敛。
arXiv论文
- 当日无新增未报道的多模态方向学术成果。
Omni 全模态
厂商动态
- 暂未捕获到该方向当日新增未报道厂商动态。
arXiv论文
- Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model:针对全模态生成模型的物理世界推理能力构建评估框架,重点测试多视角空间推理、音频歧义消解等核心能力。
具身智能
厂商动态
- 此前9月29日曾报道全球首台搭载全国产化电子架构的具身智能机器人亮相,当日无新增厂商动态。
arXiv论文
- Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents:提出具身智能体引导式自提升框架,通过场景重构、模拟练习、真实落地三阶段流程,降低智能体落地真实场景的训练成本。
- FluxVLA Engine: A One-Stop VLA Engineering Platform for Embodied Intelligence:推出一站式视觉-语言-动作(VLA)工程平台,支持多形态机器人的模型训练、部署与迭代全流程。
本周趋势观察
本周大模型领域呈现“分层竞争+场景深耕”特征:谷歌Gemini 4 Argon聚焦专业垂直领域能力强化,放弃直接面向C端用户的普惠路线,标志着头部大厂商开始针对高价值专业场景打造定制化旗舰模型;开源侧国产多模态大模型性能提升明显,10B参数档位模型已能在空间理解等具身相关基准上超过国际同类产品,为端侧具身智能落地提供了高性价比的模型底座。全模态模型的评估重点开始从通用交互能力向物理世界推理、真实场景任务执行能力倾斜,与具身智能的技术融合进一步加速。