Featured image of post Qwen3.8-27B 开源即屠榜:一张显卡跑的模型,凭什么挤进旗舰梯队

Qwen3.8-27B 开源即屠榜:一张显卡跑的模型,凭什么挤进旗舰梯队

8 月 15 日阿里 Qwen 发布 Qwen3.8-27B,Hacker News 一千分、Reddit 近两千赞。官方模型卡给出 SWE-bench Pro 61.7、OSWorld 84.3,单张 24GB 显卡即可本地运行;同一时间,社区冒出「权重与 Qwen3.6 完全相同」的质疑帖。这篇文章拆解发布首日的事实、数字和争议,以及它在国产四强格局里的位置。

这篇文章的信源主要有三块:Qwen 官方放在 Hugging Face 的 Qwen3.8-27B 模型卡,Hacker News 和 Reddit r/LocalLLaMA 的讨论,以及 X 上的实测帖。先说清楚一件事:模型卡里的 benchmark(基准测试)数字是厂商自己报的,社区实测目前只有零散的单点数据。下文会把「官方说的」和「用户跑出来的」分开写。

发布首日,热度先到了

8 月 15 日,Qwen3.8-27B 权重上架 Hugging Face。几个小时之内,Hacker News 的讨论帖冲上一千分,评论六百多条;Reddit r/LocalLLaMA 那边,「IT’S OUT」发布帖当天接近两千赞。Ollama、LM Studio、Cerebras 都是当天宣布支持,Ollama 官方账号干脆直接甩出 opencode --model qwen3.8 一行命令完事。

一款 27B 的开源模型,这个待遇不算常见。往前推一周,r/LocalLLaMA 就有「Qwen 3.8-27b coming this week」的预热帖,两千多赞。热度不是发布当天才冒出来的,是攒了一整周的。

模型卡里最值得看的几个数字

官方挑的对比对象有点意思:Qwen3.6-27B(上一代同尺寸)、Qwen3.7-Plus(自家闭源 API 模型)、Muse Glimmer-30B、Opus 4.6 Max。几个关键项:

  • SWE-bench Pro 61.7,超过 Opus 4.6 Max 的 53.4。整张表里最扎眼的就是这一格
  • DeepSWE 1.1 拿了 42.2,Qwen3.6-27B 只有 13.3,一代翻了三倍
  • OSWorld-Verified 84.3,同样压过 Opus 4.6 Max 的 72.7,computer use(计算机操作)这类多模态 Agent 任务算它的主场
  • Terminal Bench 2.1 是 73.0,仍然落后 Opus 4.6 Max 的 78.2

脚注里有句话值得停下来看一眼:除 Opus 用官方报告分数外,其余模型都套着同一套 Claude Code harness(Agent 运行时框架),在相同参数下重新跑了一遍。也就是说,Qwen 是借 Anthropic 的跑鞋,在 Anthropic 的跑道上赢了客场比赛。这比单看数字有说服力。不过反过来也一样成立:换一套 harness,名次可能就变了。

另外,61.7 和 73.0 这些自报分数,未必能直接搬去对标第三方榜单。yottalabs 的跟踪报道也提醒过,3.8-Max 的 API 版本还没有第三方验证数据,27B 同样得等独立评测落地再下判断。

Qwen3.8-27B 与 Opus 4.6 Max 关键基准对比(官方自报口径)

架构上真正变了什么

模型卡披露的结构可以单独拎出来讲:27B 稠密模型,64 层,混合架构,每 16 层里 3 组 Gated DeltaNet(门控线性注意力)搭配 1 组 Gated Attention(门控注意力)。线性注意力管长上下文的低成本扩展,完整注意力管关键位置的精确检索。262K 原生上下文能压进消费级显存,靠的就是这个组合,官方标注还可扩展到 1M token。

另外两点:一是原生多模态,自带视觉编码器,支持图片和小时级视频理解;二是训练阶段就做了 MTP(Multi-Token Prediction,多 token 预测),推理加速的空间比纯解码器架构更大。thinking 模式默认开启,可以用 reasoning_effort 调深度,也支持 preserve_thinking 把历史推理上下文带进后续轮次,这个设计明显是为长程 Agent 任务准备的。

官方图片理解演示:数学题图表识别(图源 Qwen3.8-27B 模型卡)

官方视频理解演示:真实世界场景(图源 Qwen3.8-27B 模型卡)

争议面:和 3.6 是同一套权重?

热闹之外,r/LocalLLaMA 出现了一个逆风帖:「Qwen3.8-27B is identical to Qwen3.6-27B」,按发帖者描述,对比文件哈希后发现权重一致,八百多赞、一百四十多条评论。截至本文写作,Qwen 官方没有回应。

这个质疑目前没法下结论。帖子本身可能看错了文件,或者比错了对象;但也存在另一种解释:底座权重沿用,post-training(后训练)整个重做。官方 benchmark 上 3.8 对 3.6 的全面领先,确实更像训练策略的差异,而不是结构差异。官方没澄清之前,「权重是否相同」就当个开放问题挂着。社区对厂商「换皮发版」的这层警惕,也不算风声鹤唳。

它站在哪个生态位

时间线摆出来就很直观:GLM 5.2 在 6 月中旬,Kimi K3 在 7 月中旬,DeepSeek V4-Flash 在 7 月底,GLM-5.3 和 Qwen3.8 接力进 8 月。两个月里四家各出一版旗舰,国产开源从没这么密集过。Qwen3.8-27B 的差异化在尺寸:别人卷万亿参数,它把「旗舰级的 Agent 能力」压进 27B。真正对标 K3 的巨兽是同期那款 Qwen3.8-2.4T-A95B,27B 打的是本地部署和成本敏感的场景。

X 上的实测帖描绘了它的实际体验:有用户在单张 RTX 3090 上跑出约 25.4 token/s 的原始推理速度,按其描述「够日常使用」;也有人称它的编码产出「显著好于 3.6」,做出了单次生成的鲨鱼生存游戏。这些是单点样本,参考即可,别当结论。

想上手的话,路径已经很短:Ollama 拉模型一行命令,LM Studio 图形界面直接可用, transformers 和 vLLM 的官方示例代码在模型卡里都有。24GB 显存是舒服的起点,量化后门槛还能再降。

结语:小模型、上下文和 Agent 的关系

最后把几个概念的关系讲清楚。小模型解决的是成本:一张卡就能跑,试错不再按 token 计费。长上下文(262K 到 1M)解决的是容量:Agent 干活要读代码、看截图、翻历史记录,窗口小了,任务只能拆碎着喂。Agent 能力(规划、环境反馈处理、多步执行)解决的是完成度:东西都装进去了,能不能一步步干到底,看的就是这块,OSWorld 和 DeepSWE 的大幅提升,说明 Qwen 这一代的重心恰恰压在这里。

这三样少了哪一样,「本地跑 Agent」都立不住。Qwen3.8-27B 做到的事,是在 27B 这个尺寸上第一次把三项都推过了可用线。至于榜单数字能不能被独立评测复现、权重争议怎么收场,接下来几周自会有答案。

小模型、长上下文、Agent 能力三者的关系

参考来源

以上来源中,模型卡数字为厂商自报,Reddit 与 X 内容为社区单点实测和观点,均不等同于独立基准测试,选型前建议自行验证。

RSS Feed 使用 Hugo 构建
主题 StackJimmy 设计