定价与倍率
计费公式
500,000是内部单位换算(500,000 quota = $1)ModelRatio决定"这个模型多贵"CompletionRatio决定"输出 token 相对 input 的贵度倍数"GroupRatio决定"分组折扣"- 命中 prompt 缓存的 input token 另按
CacheRatio计(见下)
各模型倍率(原价,未乘 GroupRatio)
| 模型 | ModelRatio | CompletionRatio | 折算 $/M input | 折算 $/M output |
|---|---|---|---|---|
deepseek-v4-flash | 0.075 | 2 | $0.15 | $0.30 |
deepseek-v4-pro | 0.22 | 2 | $0.44 | $0.88 |
claude-opus-4-6 | 2.5 | 默认 4 | $5.00 | $20.00 |
claude-opus-4-7 | 2.5 | 默认 4 | $5.00 | $20.00 |
claude-opus-4-8 | 2.5 | 5 | $5.00 | $25.00 |
claude-sonnet-5 | 1.5 | 5 | $3.00 | $15.00 |
claude-sonnet-4-6 | 1.5 | 5 | $3.00 | $15.00 |
gpt-5.5 | 2.5 | 6 | $5.00 | $30.00 |
qwen3.7-max | 0.885 | 3.01 | $1.77 | $5.32 |
glm-5.2 | 0.59 | 3.5 | $1.18 | $4.13 |
kimi-k2.7-code | 0.48 | 4.16 | $0.96 | $3.99 |
kimi-k2.6 | 0.48 | 4.16 | $0.96 | $3.99 |
TIP
$/M = 每一百万 tokens 的价格(USD)。这是原价,还要乘 GroupRatio 才是你实际付的。
qwen3.7-plus
qwen3.7-plus 目前未单独配置倍率,按平台默认结算,最终价格以控制台账单为准;对成本敏感的批量任务建议先用 qwen3.7-max 或联系管理员确认。
claude-fable-5(旗舰 · Claude Code 专用)
旗舰模型 claude-fable-5 走独立分组 claude-fable,定价与 Claude 家族同档,精确倍率以控制台「模型广场 / 定价」为准。它依赖 Claude Code 的累进 prompt 缓存,长会话缓存命中率高、实际单价随缓存显著下降。
各分组倍率
| 分组 | GroupRatio | 说明 |
|---|---|---|
deepseek | 1.0 | DeepSeek 原价 |
Claude-Stable | 0.4 | Claude 系 4 折 |
Claude-ESpeed | 0.4 | Claude 系 4 折 + 优先带缓存渠道 |
GPT | 0.4 | GPT 系 4 折 |
qwen | 0.7 | 通义千问 7 折 |
GLM | 0.7 | 智谱 GLM 7 折 |
kimi | 0.7 | Kimi 7 折 |
default | 1.0 | 默认组(一般 Key 不会用) |
客户实付价(原价 × GroupRatio)
按你实际用的分组,一百万 tokens 到手价大致如下(USD;乘 ¥7.3 得人民币):
| 模型(分组) | $/M input | $/M output |
|---|---|---|
claude-opus-4-8(Claude-ESpeed / Stable) | $2.00 | $10.00 |
claude-sonnet-5(Claude-ESpeed / Stable) | $1.20 | $6.00 |
claude-sonnet-4-6(Claude-ESpeed / Stable) | $1.20 | $6.00 |
gpt-5.5(GPT) | $2.00 | $12.00 |
qwen3.7-max(qwen) | $1.24 | $3.72 |
glm-5.2(GLM) | $0.83 | $2.89 |
kimi-k2.7-code(kimi) | $0.67 | $2.79 |
deepseek-v4-pro(deepseek) | $0.44 | $0.88 |
deepseek-v4-flash(deepseek) | $0.15 | $0.30 |
举例算一算
Q1: 用 claude-opus-4-8 在 Claude-ESpeed 分组,input 1000 tokens + output 500 tokens
Q2: 用 gpt-5.5,input 2000 + output 1000
Q3: 用 glm-5.2 在 GLM 分组,input 5000 + output 1000
结论:DeepSeek Flash 便宜到几乎白送;国内模型(Qwen / GLM / Kimi)7 折后适合大批量中文任务;Claude Opus × ESpeed 是 Claude 系性价比之选;GPT-5.5 输出很贵,谨慎设 max_tokens。
缓存能省多少?
命中 prompt 缓存的 input token 只按 CacheRatio 计费。Claude / GPT / Kimi 系命中后 input 只算 10%(CacheRatio = 0.1),GLM / Qwen 约 10-25%,DeepSeek 更低。
Claude-ESpeed 分组优先走带 prompt caching 的渠道:同一段 prompt(系统提示、长文档等)在缓存窗口内被重复调用,命中部分的 input 费用直接打到一折附近。
场景举例:
- 你用 Claude Code 反复问同一份代码库的问题
- 你的 Bot 有一段很长的 system prompt,每次对话都带
- Cline / Cursor 每次都发整个上下文
这些场景 必用 ESpeed,长期节省显著(可以省 30-70% input 费用)。
判断缓存有没有生效:看返回的 usage.prompt_tokens_details.cached_tokens,非零就是命中了。
常见误解
- 「模型 A 比模型 B 便宜就选 A」 → 便宜的模型可能需要更多 tokens 才能得到同样质量的输出,实际总费用可能反而更高。多测。
- 「temperature=0 更便宜」 → 温度不影响价格,只影响输出确定性。
- 「max_tokens 设很大更贵」 → 不是。
max_tokens只是上限,实际按真实输出算。 - 「reasoning_tokens 是什么,为啥算钱」 → DeepSeek Pro / GPT-5.5 会先"思考"再输出,思考过程也算 output tokens,会算钱。
定价何时会变
平台会尽量提前公告:
- 每周有变化 → 邮件/QQ 群/控制台公告
- 计划维护 → 提前 24 小时通知
- 紧急调价(上游倒了 / 官方涨价 / 汇率剧变)→ 生效后 6 小时内公告
定价页面(本页)会保持随时最新。跟踪变化用 changelog 或订阅公告。