如意小报
版块首页原文 ↗
AI · 新闻详情

一张3090就能跑!全栈国产模型,把AI办公搬到企业本地

大模型 · 量子位 · 量子位 · 2026-09-20 · 重磅值 29.34
真正值得关注的不是量子位这一条动作本身,而是它可能把「大模型」的竞争焦点推向能力、成本与开放生态的再平衡。
发生了什么:AI办公这块蛋糕,中国电信可能要先切走一块了。
为什么重要:模型能力的变化,可能重塑下一批产品的技术底座。
观察窗口:后续要看开放范围、价格策略、真实评测以及开发者是否愿意迁移。
正文来源:原文正文机器翻译
原文链接:https://www.qbitai.com/2026/09/492946.html

这个夏天,大厂们集体加注AI办公。卷Agent能力,卷工作入口,卷企业工作流,Coding之后,办公成了Agent的下一个必争之地。

原因现实得很扎心。他们数据不能出域,模型最好就地部署,手头算力又不算富裕。可偏偏,长文档要读,复杂业务要办,该干的活一样不少。

中国电信AI这次最新开源的 Xing4.0-29B-A4B ,瞄准的就是这批需求。

而且,这次带来的还是一款 全栈国产化的轻量级代码智能体大模型 。从国产芯片、国产训练框架,到模型训练和推理部署,整条技术链路都做了系统适配。

为了尽可能实现本地部署,Xing4.0-29B-A4B采用 MoE 架构, 290亿 的总参数,每次推理只激活约 40亿 参数,经过4-bit量化后,一张 RTX 3090 就能运行。

比如,处理重要文档时,模型可以直接在本地完成内容理解、指标提取和信息整理,数据全程不用离开企业环境。

再比如,一份200页的投标文件交过来,模型能在本地用约20分钟,完成技术、商务、价格三个方面的初评,并逐条给出评分依据。

Xing4.0-29B-A4B完全基于 华为昇腾910C算力 训练,并采用国产的 MindSpore/MindFormers训练框架与开发套件 ,真正实现了 国芯训国模 。

在推理部署端,它还完成了昇腾的适配验证。可以说,从训练到落地,国产算力这条路也已经走通。

目前,模型已经在GitHub、Hugging Face、Gitee、魔搭、魔乐等平台开源上线,并同步支持API调用。

值得一提的是,截止发稿,Xing4.0-29B-A4B现在已经冲进HuggingFace模型趋势榜单,位居第四。

老实说,把模型装进一张显卡,和让它稳稳接住企业的日常工作,中间还隔着不少事。

一份文档读完了,可能还要提取信息、调用工具、核对结果,最后整理成一份能交出去的材料。

要满足这些要求,既要继续压低部署和运行成本,也得把干活的能力练扎实。后者,正是Xing4.0-29B-A4B这次重点加强Coding和Agent能力的原因。

过去,百亿参数模型写代码,一个常见的问题就是写个函数、补几行代码还行。

可一旦把整个代码仓库交过去,要求它解决一个真正的工程问题,事情就没那么顺了。

因为它需要先看懂项目结构,跨文件追踪接口调用,再结合文档、日志和历史上下文定位问题。改完之后,还得验证修改有没有用,会不会影响其他地方。

针对这个老大难问题,Xing4.0-29B-A4B这次把Coding能力,从「写片段」进一步推向了「干工程」。

它原生支持 256K上下文,并可扩展至512K ,让一次任务能够装下更长的代码、文档、日志和历史记录,为理解整个项目提供空间。

比如,要把分散在Excel里的合同台账做成管控大屏,需要的就不只是一个画图函数。

模型还要理解表格里的业务数据,将合同概览、金额分布、风险识别和履约预警等需求,组织到同一个页面中。

这里既涉及数据理解,也涉及代码生成和功能组织,需要结合前后的信息完成开发。

Xing4.0-29B-A4B可以在企业本地,将这些合同台账转化为可视化管控大屏,数据全程不用离开企业环境。

理解需求之后,模型得自己拆解任务、安排执行顺序、调用工具,再根据中间结果决定下一步怎么做。

一路做下去,直到交付一个可以验收的结果。Xing4.0-29B-A4B针对这类长程任务做了专项强化。

比如,用户一次说清需求后,模型可以判断哪些步骤先做、哪些可以并行,再调用天气、日程、提醒、出行等不同工具或Agent,把任务继续推进。

企业已经在用的开发工具、Agent框架和部署平台,都得接得上。否则,光是换一套环境,就可能先多出一堆工作。

为此,Xing4.0-29B-A4B已经针对OpenCode、Claude Code、OpenClaw、Hermes等主流Agent、Harness框架完成定向适配,同时兼容LLaMA-Factory、MindFormers、SGLang、vLLM、KTransformers等常用工具链,降低接入现有开发环境的门槛。

所以除了能力升级,Xing4.0-29B-A4B也在继续把部署门槛往下压。

传统FP16精度下,29B参数模型单卡显存占用约60GB,往往需要多卡或者价格高昂的A卡。

经过4-bit量化后,这部分占用可以压缩至约15GB,降低约75%,让RTX 3090、4090等消费级显卡也能运行。

在智能客服业务中,Xing4.0-29B-A4B已经完成私有化部署,用户通话、身份信息和业务记录全程不出域。

面对复杂诉求,模型需要一路完成意图理解、任务拆解、工具调用、结果整合和合规校验。

模型有290亿总参数,但每次推理只激活约40亿。这样一来,每次处理任务时,就不必把全部参数都调动一遍,计算开销也随之降低。

但要让它读长文档、写工程代码,再把一个多步骤任务持续做下去,光靠MoE还不够。

上下文越长,模型能读进去的内容就越多。可问题是,读进去的内容,也要占地方。

模型处理长文档时,会把前文的一部分计算结果存下来,方便后续生成时复用,这就是大家熟悉的KV Cache。

Xing4.0-29B-A4B采用的MLA多头潜变量注意力,做的就是这件事:把需要缓存的信息压缩成更紧凑的形式,降低长上下文推理的显存开销。

进一步,读进去的开销降下来了,生成速度也得跟上。在这里,Xing4.0-29B-A4B还采用了MTP,也就是多Token预测。

相比常规训练主要让模型预测下一个Token,MTP则让模型同时学习预测后续多个Token,从中学习更长的前后关联。

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…