这篇文章的信源主要有三块:Qwen 官方放在 Hugging Face 的 Qwen3.8-27B 模型卡,Hacker News 和 Reddit r/LocalLLaMA 的讨论,以及 X 上的实测帖。先说清楚一件事:模型卡里的 benchmark(基准测试)数字是厂商自己报的,社区实测目前只有零散的单点数据。下文会把「官方说的」和「用户跑出来的」分开写。
发布首日,热度先到了
8 月 15 日,Qwen3.8-27B 权重上架 Hugging Face。几个小时之内,Hacker News 的讨论帖冲上一千分,评论六百多条;Reddit r/LocalLLaMA 那边,「IT’S OUT」发布帖当天接近两千赞。Ollama、LM Studio、Cerebras 都是当天宣布支持,Ollama 官方账号干脆直接甩出 opencode --model qwen3.8 一行命令完事。
一款 27B 的开源模型,这个待遇不算常见。往前推一周,r/LocalLLaMA 就有「Qwen 3.8-27b coming this week」的预热帖,两千多赞。热度不是发布当天才冒出来的,是攒了一整周的。
模型卡里最值得看的几个数字
官方挑的对比对象有点意思:Qwen3.6-27B(上一代同尺寸)、Qwen3.7-Plus(自家闭源 API 模型)、Muse Glimmer-30B、Opus 4.6 Max。几个关键项:
- SWE-bench Pro 61.7,超过 Opus 4.6 Max 的 53.4。整张表里最扎眼的就是这一格
- DeepSWE 1.1 拿了 42.2,Qwen3.6-27B 只有 13.3,一代翻了三倍
- OSWorld-Verified 84.3,同样压过 Opus 4.6 Max 的 72.7,computer use(计算机操作)这类多模态 Agent 任务算它的主场
- Terminal Bench 2.1 是 73.0,仍然落后 Opus 4.6 Max 的 78.2
脚注里有句话值得停下来看一眼:除 Opus 用官方报告分数外,其余模型都套着同一套 Claude Code harness(Agent 运行时框架),在相同参数下重新跑了一遍。也就是说,Qwen 是借 Anthropic 的跑鞋,在 Anthropic 的跑道上赢了客场比赛。这比单看数字有说服力。不过反过来也一样成立:换一套 harness,名次可能就变了。
另外,61.7 和 73.0 这些自报分数,未必能直接搬去对标第三方榜单。yottalabs 的跟踪报道也提醒过,3.8-Max 的 API 版本还没有第三方验证数据,27B 同样得等独立评测落地再下判断。

架构上真正变了什么
模型卡披露的结构可以单独拎出来讲:27B 稠密模型,64 层,混合架构,每 16 层里 3 组 Gated DeltaNet(门控线性注意力)搭配 1 组 Gated Attention(门控注意力)。线性注意力管长上下文的低成本扩展,完整注意力管关键位置的精确检索。262K 原生上下文能压进消费级显存,靠的就是这个组合,官方标注还可扩展到 1M token。
另外两点:一是原生多模态,自带视觉编码器,支持图片和小时级视频理解;二是训练阶段就做了 MTP(Multi-Token Prediction,多 token 预测),推理加速的空间比纯解码器架构更大。thinking 模式默认开启,可以用 reasoning_effort 调深度,也支持 preserve_thinking 把历史推理上下文带进后续轮次,这个设计明显是为长程 Agent 任务准备的。


争议面:和 3.6 是同一套权重?
热闹之外,r/LocalLLaMA 出现了一个逆风帖:「Qwen3.8-27B is identical to Qwen3.6-27B」,按发帖者描述,对比文件哈希后发现权重一致,八百多赞、一百四十多条评论。截至本文写作,Qwen 官方没有回应。
这个质疑目前没法下结论。帖子本身可能看错了文件,或者比错了对象;但也存在另一种解释:底座权重沿用,post-training(后训练)整个重做。官方 benchmark 上 3.8 对 3.6 的全面领先,确实更像训练策略的差异,而不是结构差异。官方没澄清之前,「权重是否相同」就当个开放问题挂着。社区对厂商「换皮发版」的这层警惕,也不算风声鹤唳。
它站在哪个生态位
时间线摆出来就很直观:GLM 5.2 在 6 月中旬,Kimi K3 在 7 月中旬,DeepSeek V4-Flash 在 7 月底,GLM-5.3 和 Qwen3.8 接力进 8 月。两个月里四家各出一版旗舰,国产开源从没这么密集过。Qwen3.8-27B 的差异化在尺寸:别人卷万亿参数,它把「旗舰级的 Agent 能力」压进 27B。真正对标 K3 的巨兽是同期那款 Qwen3.8-2.4T-A95B,27B 打的是本地部署和成本敏感的场景。
X 上的实测帖描绘了它的实际体验:有用户在单张 RTX 3090 上跑出约 25.4 token/s 的原始推理速度,按其描述「够日常使用」;也有人称它的编码产出「显著好于 3.6」,做出了单次生成的鲨鱼生存游戏。这些是单点样本,参考即可,别当结论。
想上手的话,路径已经很短:Ollama 拉模型一行命令,LM Studio 图形界面直接可用, transformers 和 vLLM 的官方示例代码在模型卡里都有。24GB 显存是舒服的起点,量化后门槛还能再降。
结语:小模型、上下文和 Agent 的关系
最后把几个概念的关系讲清楚。小模型解决的是成本:一张卡就能跑,试错不再按 token 计费。长上下文(262K 到 1M)解决的是容量:Agent 干活要读代码、看截图、翻历史记录,窗口小了,任务只能拆碎着喂。Agent 能力(规划、环境反馈处理、多步执行)解决的是完成度:东西都装进去了,能不能一步步干到底,看的就是这块,OSWorld 和 DeepSWE 的大幅提升,说明 Qwen 这一代的重心恰恰压在这里。
这三样少了哪一样,「本地跑 Agent」都立不住。Qwen3.8-27B 做到的事,是在 27B 这个尺寸上第一次把三项都推过了可用线。至于榜单数字能不能被独立评测复现、权重争议怎么收场,接下来几周自会有答案。

参考来源
- Qwen3.8-27B 官方模型卡(Hugging Face)
- Hacker News:Qwen 3.8 27B 发布讨论帖
- Reddit r/LocalLLaMA:IT’S OUT 发布帖
- Reddit r/LocalLLaMA:Qwen3.8-27B is identical to Qwen3.6-27B 质疑帖
- yottalabs:Qwen 3.8 27B 规格与硬件要求
- X @ollama 官方支持公告
- X @sudoingX 单卡 3090 实测
- 国产开源大模型旗舰横评 2026
以上来源中,模型卡数字为厂商自报,Reddit 与 X 内容为社区单点实测和观点,均不等同于独立基准测试,选型前建议自行验证。