
Qwen3.8-Max模型今日发布 ,几个值得关注的点:
Qwen3.8 为 2.4T 总参、95B 激活的旗舰模型,支持 1M 超长上下文,编程、Agent、科研多维度评测表现顶尖,多项研究类基准达成全球第一。模型 API 定价性价比突出,显著低于 Fable5,下周开放开源权重,现已接入千问办公,兼容主流 API 协议与开发工具。
规格层面:2.4T 参数 95B激活,支持 1M token 超长上下文,兼容 OpenAI/Anthropic API,能直接接入 Claude Code、Codex 等主流开发工具。
能力层面:编程10 项基准全面上涨,较于上代 Qwen3.7-Max平均提分 +21 分,最大涨幅 162%,直接修生产代码的硬核工程任务(SWE-Pro / FrontierSWE)测评中,目前在所有模型中仅小幅落后 Fable5。在测试中能独立连肝 16 天项目编程,24 小时比赛击败 87% 人类队伍。Agent 7 项基准全面上涨,平均提分 +15 分,Agent、办公等任务中估计表现会更好。
更多优势:论文复现+改进超越 GPT 和 Claude,在“研究复现(PaperBench)+ 视觉理解(BabyVision / PerceptionBench)+ 具身推理(ERQA)+ 自主操作(OSWorld-Verified)”这条线研究类评测做到世界第一。
价格适中:API价格方面,Qwen3.8每百万Tokens输入2美元、输出6美元;Deepseek V4-Flash 每百万输入 Token 收费 0.14 美元,每百万输出 Token 收费 0.28 美元;Fable 5 是每百万输入 token 10 美元、输出 token 50 美元。Fable 5的输出成本大约是Qwen3.8的八倍,即将发布的Deepseek V4 Pro是Qwen3.8比较强劲的竞争对手。
下周 Hugging Face 和 ModelScope 发布开源权重,近日刚公测的千问办公已经接入最新模型。