如意小报
版块首页原文 ↗
AI · 新闻详情

通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队

大模型 · 量子位 · 量子位 · 2026-09-16 · 重磅值 92.73
真正值得关注的不是量子位这一条动作本身,而是它可能把「大模型」的竞争焦点推向能力、成本与开放生态的再平衡。
发生了什么:九大空间测试10B规模通用模型中8项第一
为什么重要:模型能力的变化,可能重塑下一批产品的技术底座。
观察窗口:后续要看开放范围、价格策略、真实评测以及开发者是否愿意迁移。
正文来源:原文正文机器翻译
原文链接:https://www.qbitai.com/2026/09/490839.html

九大国际权威空间理解基准测试中, 八项断档第一 ,通用能力还能不打折。

紫东太初最新开源的通用多模态大模型 ZDTaichu5.0-9B ,直接把10B以下通用模型空间具身的天花板又往上顶了一大截。

过去的多模态模型,已经能把一张图片理解得头头是道,但一旦走进真实物理世界,空间理解与行动能力往往就跟不上;而一些模型为了补足空间能力,又不得不以牺牲通用能力为代价。

如果让人来做,应当是个非常简单的过程: 拉开抽屉→放进去→再关闭 。但具身不一样,一连串的动作背后都是相当细致的空间判断。

每一步都要承接住上一步带来的变化,动作才能看起来顺,这对模型能力的考验是极为苛刻的,而ZDTaichu5.0-9B已经能完成 复杂的空间理解和高层任务规划 。

与此同时,对于这个只有9B大小的模型,其图文理解、文字识别、数学推理和代码能力也依旧稳居 第一梯队 。

这个 空间感知任务 对于机器人来说,是后续执行任务的大前提。指错了,后面的抓取动作再准确,执行的也是另一个任务。

画面中,台面挤满杯子、收纳容器和各种杂物,干扰项较多。模型得同时读懂银色这个关键属性、盒子这个对象,以及从左到右第二个这层空间排列关系。

从对比演示中看,ZDTaichu5.0-9B给出的 归一化坐标 (237,226)最为精准,落在目标标注区域内。

输入的是同一房间的三个视角。模型需要设想自己移动到绿框窗帘所在的位置,面向蓝框沙发,再判断红框柜子相对自己的方位。

其中模型得把不同画面中的对象一一对应起来,再根据新的观察位置和朝向转换参照系。

再往前一步,空间判断还得回答哪里具备操作条件,给予机器人接下来的操作以方便。

比如这道 「找空位」 ,要求在最右侧杯子的杯柄方向上,找一块空闲区域。

结果也不出所料,ZDTaichu5.0-9B依旧稳稳 落入正确区域 。

当我们把三个例子放在一起看,它们分别对应目标选择、参照系转换和交互条件判断,都在机器人执行真实物理任务中扮演关键要素。

在所列的10B档位开闭源模型中,ZDTaichu5.0-9B几乎是 断层领先 。

比如差距较大的MindCube-tiny,ZDTaichu5.0-9B的得分是78.27分,Gemma4 8B-E4B、Gemini 3 Pro和Grok 4分别是48.8462、70.87和63.56。

整个榜单把 空间感知、三维推理、多视角变换、具身交互 都囊括在内了,可谓是面面俱到,足见ZDTaichu5.0-9B已彻底看懂物理场景该怎么操作。

考完空间能力之后,另一个重要问题随之而来: 通用能力 还hold得住吗?

图解理解基准AI2D达到 91.48分 ,仅次于Gemini 3 Pro,高于其它所有对照模型。

WeMath为75.9分,同样领先;MathVista Mini为84.5分、OCRBench为85.5分,表现颇具竞争力。

除此之外,ZDTaichu5.0-9B在 Agent与文本任务 上也依旧表现突出,尤其是代码成绩。

这些能力具体怎么组合起来用, 科研Agent 的阻尼振子求解demo给出了直观展示。

该问题要求Agent组织解析求解与Python/SciPy数值计算,并对照两种结果,最后生成相空间图、位移与速度曲线,以及分析报告。

ZDTaichu5.0-9B在整个过程中也丝毫没有掉链子,在问题理解、代码执行、结果核对和图表输出四个阶段子任务上都完美实现连续衔接,最后输出非常完整。

要同时兼顾 空间具身能力与通用能力 两条线,背后要解决的有很多,例如数据如何组织,以及复杂判断时算力怎么分配。

紫东太初先是围绕这一需求,组织了一套 经过全流程验证 、 可复用 、 可迁移 的数据工程链路。

这一步数据覆盖开源图文、网页结构化文档、公开视频多视角素材和仿真渲染三维场景。

原始素材进入管线后,先通过 感知哈希 与 URL 去重,再过滤低清晰度、图文不相关等较差的样本,随后进行内容重写解析和视频抽帧描述,最终打包组织成可训练的图文与时序输入。

开源SFT指令、真实业务问答、空间具身案例,以及Agent工具调用轨迹,都被组织成多轮对话、多图和视频序列。

其中针对 具身样本 ,管线还会检查图像、问题、对象关系和操作约束是否一致。还是以开头的美工刀收纳举例,如果图中抽屉关着,模型就不能直接要求夹爪往里放东西。

带步骤的思维链 也要经过拒绝采样、格式和一致性校验。这样进入训练的,才是有视觉依据、能解释操作顺序的任务样本。

团队为数据建立 能力域-难度-质量标签三维自动标签系统 ,为模型筛选高信息量样本。

值得注意的是,评测数据不会直接作为训练样本,标签也只是用于提供能力分类与样本筛选的参照。

GRPO 则把答案是否正确、空间坐标是否命中、输出格式是否合规,都通通转化成可自动校验的奖励信号,让模型沿着具体反馈继续改进。

未来即使是企业自己的车间录像、实验操作记录和仿真素材,也都可以通过这条路径转化成训练样本。

但训练数据只是打好了地基,再往上, 每次推理的难度也会随着任务变化 。

比如有些画面中目标清楚、关系简单;有些任务则要整合多个视角,还要判断遮挡和操作前提。

ZDTaichu5.0-9B为此引入了 内置自适应循环推理 ,让模型根据预测的不确定性,决定当前Token是否需要再算几轮。

具体来说,模型先完成一次标准前向计算,得到Token预测分布和隐层状态。 熵门控 随后评估预测的不确定程度,分布越分散,意味着模型对输出的把握越小。

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…