小智爱吃回锅肉 · 2026-09-22

没用英伟达训出来的

这两年所有能打的大模型,背后都是同一家公司的卡。上周有个例外,而且出自一个你想不到的地方。

中国电信开源了一个模型,叫 Xing4.0-29B-A4B,前身是他们做了几年的 TeleChat。

先说定位,它不是拿来陪聊的。官方冲的是写代码和敲命令行这类活:两百九十亿总参数,但每处理一个词只唤醒其中四十亿,六十四个专家里按需路由。许可是 Apache 2.0,权重扔在 Hugging Face 和魔搭上随便下。

分数我去核了一遍,顺便把它自己没好好说的部分也看了。

在 SWE-bench Verified 上——这个基准是让模型去修真实的 GitHub 缺陷——它拿到 75.0 分。对照组里 Gemma4 是 53.0,差了一大截;Qwen3.6 是 76.0,比它高一分。Terminal-Bench 上反过来,它 57.5,Qwen3.6 是 51.5。

推广文案只说"只比 Qwen3.6 差一分,爆锤 Gemma4"。完整的情况是:跟 Qwen3.6 各有胜负,它赢在终端操作和几项代理任务,输在代码修复的几个子项上。

这种有输有赢的成绩,在开源模型圈其实不算新闻。这个月能打的开源模型太多了。

真正少见的是另一件事:它的训练,全程没用英伟达。

整条链路跑在华为昇腾的 Atlas 900 上,框架用的是 MindSpore。官方的说法是,这是这个规模上第一个完全在国产算力平台上从头训完的模型,中间把多头潜注意力、几个自定义算子和通信重叠这些硬骨头一一调通,系统吞吐比优化前提升了约九成六。

这件事的分量不在性能榜上。

过去两年有个默认前提:想训一个能打的模型,绕不开英伟达的卡和 CUDA 那套生态。不是说别的芯片不能算,是整套工具链、算子库、社区经验都长在那上面,换一条路等于重造轮子,而且多半吃力不讨好。

现在有人把这条路走完了,还把结果开源出来了。它证明的不是国产芯片更好——没有任何证据支持这个说法——而是这条路走得通,成品拿得出手。对一个被卡脖子卡了几年的行业来说,这是完全不同性质的消息。

还有个细节值得说。

推文底下有人留了句挺刻薄的话:为了把 token 当流量卖也是拼了。

刻薄,但说到点子上了。运营商这门生意,一百多年来干的就是同一件事——修管道,按流量收钱。他们不生产内容,也不在乎管道里流的是电话、短信还是视频。

现在流的东西换成了 token。

从这个角度看,一家电信运营商跑去训大模型、还把模型开源,其实一点都不违和。把模型白送,卖后面的算力和接口,这跟当年手机白送、话费按月收,是同一本账。

所以它选择开源,未必是理想主义。更可能是这家公司太清楚自己卖的是什么。

#昇腾#中国电信
原文出处:Xing4.0-29B-A4B — 中国电信开源的 MoE 模型
https://huggingface.co/XingChen-AGI/Xing4.0-29B-A4B
我照着上面那篇原文写的,事实以原文为准。
读到不对的地方,欢迎指出来。