← Journal
  • 免费
CraftFEB 15, 20264 min

春节这波 OpenRouter 榜单,为什么中国开源模型突然冲上去了

收录于 AI 模型选型与评估 →

春节这波 OpenRouter 榜单,为什么中国开源模型突然冲上去了

【核心内容】

春节期间,OpenRouter 的日 token 消耗榜上,中国开源模型冲得很猛。核心想说的不是“谁第一”,而是一个更实际的问题:为什么越来越多人开始把 agent、编程助手、自动化工作流,切到这批“便宜但还算能打”的开源模型上。

说白了,大家不是突然爱国,也不是免费白嫖带来的虚高,很多模型本身就是收费的。真正推动使用量上去的,是成本和效果终于碰到了一个能落地的平衡点。

适合谁看

  • 正在用 OpenRouter 跑模型的人
  • 想做 agent、自动化、代码生成,但又扛不住闭源旗舰账单的人
  • 用 OpenClaw、类似工作流工具,已经开始算 token 成本的人
  • 想找“能用、够便宜、风险可控”模型组合的人

如果你只是偶尔问几句,不跑长链路任务,这类榜单参考价值没那么大。

先说结论

这波榜单背后,最关键的信号就两个:1. 便宜的准旗舰开源模型,正在吃掉一部分闭源低价模型的市场。2. 真正把使用量推高的,不是“免费”,而是“拿来跑 agent 时还算划算”。

几个价格对比,能直接看出这个趋势:

  • minimax m2.5:输入 $0.3 / 输出 $1.2
  • k2.5:输入 $0.45 / 输出 $2.2
  • glm5:输入 $0.8 / 输出 $2.56
  • gemini-3-flash:输入 $0.5 / 输出 $3
  • gpt-5.1-codex-mini:输入 $0.25 / 输出 $2
  • haiku-4.5:输入 $1 / 输出 $5

放到 agent 场景里,输出 token 往往烧得很快。你真让它写代码、反复试错、跑多轮调用,账单不是一点点涨,是很容易直接失控。判断 OpenClaw 的流行,可能就是这类低价开源模型使用量暴增的原因之一,这个判断是成立的。

你需要准备什么

如果你想照这个思路自己试,先准备这几样:

  • OpenRouter 账号
  • 你要接的 agent 工具,比如 OpenClaw
  • 一套预算上限,别先跑爽了再看账单
  • 至少两档模型方案:主力模型 + 兜底便宜模型
  • 记录成本的方法,哪怕只是按任务记一次输入输出 token

如果你准备走 OAuth 方式接入某些闭源服务,已经给了风险提示:封号风险不是猜测,是实际存在的。

按这个顺序做

1. 先确定你的任务类型

如果你做的是:

  • 长对话、多轮工具调用
  • 代码生成和修改
  • 自动化执行链路
  • 批量内容处理

那你最该先看的是“输出 token 单价”,不是宣传页上的能力标签。

2. 先用低价准旗舰开源模型做主力

点名 OpenClaw 官方更推荐 minimax,这类模型的优势很直接:

  • 价格压得住
  • agent 场景下不至于太笨
  • 比一批闭源低价模型更有性价比

适合拿来跑日常主流程,尤其是高频、长链路任务。

3. 不要一上来就用闭源旗舰硬烧

像 gemini-3-pro、gpt-5.3-codex、opus4.6、sonnet4.5 这种,能力强归强,但只要任务稍微复杂一点,token 消耗就会非常夸张。你用一两次不觉得,连续跑几天就知道什么叫肉疼。

如果业务不是“这一步必须最强模型”,先别把旗舰当默认选项。

4. 低价闭源模型也别盲信

意思很明确:flash、gpt-mini、haiku 这类虽然便宜,但不少人会嫌 agentic 能力差。换句话说,省下来的钱,可能会在失败重试、结果不稳定、人工返工里重新亏回去。

所以判断标准不是“便宜”,而是“便宜之后还能不能把事做完”。

5. 涉及 OAuth 接入,先把风险算进去

  • 廉价接入 Antigravity,已经明确有封号情况
  • OAuth 接 Claude Code,也容易封号

这不是“技术上能接就可以接”的问题,而是账号资产值不值。主账号、长期工作账号,不建议拿去赌这种边缘方案。

这里最容易踩坑

把榜单当能力榜

这类榜单更像“消耗榜”,不是“质量榜”。谁 token 烧得多,不等于谁最好用,也可能只是更便宜、更适合跑长任务。

只看输入价格,不看输出价格

很多 agent 任务真正贵的是输出。模型一边推理一边生成,输出 token 会堆得很快。看单价时,只盯输入,基本等于没算账。

误以为收费模型上榜就一定是自然增长

对榜单也有保留:不排除厂家或 AI 云自己买自己 API 刷榜。这个质疑不能直接当事实,但也别把榜单完全当成真实市场份额。最稳的办法还是自己跑一轮任务,再看成本和结果。

对陌生模型只看名字就开跑

第七名的 Trinity Large 是免费公测模型,但没说清是哪家的。遇到这种情况,不要急着进生产链路。这里没展开,建议自行验证。

我的建议

如果你现在就在用 OpenRouter 跑 agent,最实际的策略不是站队,而是分层:

  • 主力层:用价格能接受、agent 表现稳定的准旗舰开源模型
  • 兜底层:配一个更便宜的模型处理低风险任务
  • 决胜层:只把最贵的闭源旗舰留给关键节点

这样做的好处很直接:大部分任务成本能压住,关键质量也不至于全丢。

再说得更直一点,春节这波榜单最有价值的信息不是“中国模型赢了”,而是市场开始用脚投票:只要模型够便宜、能力别差得太离谱,大家就会把真实工作负载切过去。尤其在 agent 时代,价格不是附属条件,价格本身就是能力的一部分。