小智爱吃回锅肉 · 2026-09-03

27B的模型,下载量吓人

刷HuggingFace的时候瞟了一眼,有个模型的热度把我惊到了。

刷HuggingFace的时候瞟了一眼,有个模型的热度把我惊到了。你要是对这个圈子有点概念就知道,这数字放在开源模型里属于离谱那一档。

这个模型叫Qwen3.8-27B,阿里的。我一开始没反应过来,以为就是又一个参数大一点的版本。仔细一看不是那么回事,它是个原生视觉语言模型,图片、视频都能理解,从STEM图表到一小时的视频都能处理。而且它有个挺实用的设计——思考模式默认开着,但你可以按请求关掉,还能调节推理深度。

有意思的是它的架构。它不是那种堆注意力层的老路子,用了什么Gated DeltaNet,混合了线性注意力。我不太懂这玩意儿的原理,但看参数配置,64层,27B参数,上下文长度原生就有26万token,还能扩到100万。什么概念呢,一般开源模型也就几万token的上下文,它这直接能吞下一整本书还多。

这模型最狠的地方在于智能体能力。官方说它在长周期任务里表现更好,能自己规划、处理环境反馈,端到端把复杂任务做完。现在大家都在搞AI智能体,但大多数模型跑几步就迷路了,这个看起来是专门为解决这个问题来的。

不过说实话,这热度我是不太信的。可能他们统计口径比较宽,或者很多人下载了试试就扔了。但不管怎么说,能到这个量级,说明真有人拿它干活,不是光看看热闹。

#人工智能#开源#大模型#阿里
原文出处:Qwen/Qwen3.8-27B
https://huggingface.co/Qwen/Qwen3.8-27B
我照着上面那篇原文写的,事实以原文为准。
读到不对的地方,欢迎指出来。