2026 年国内外主流大模型 API 价格对比:GPT、Claude、Gemini、DeepSeek、Kimi、千问、MiniMax 怎么选?

2026 年国内外主流大模型 API 价格对比:GPT、Claude、Gemini、DeepSeek、Kimi、千问、MiniMax 怎么选?

大模型能力越来越强,但不同厂商的计费方式也越来越复杂。

除了最基本的输入 Token 和输出 Token,现在还需要考虑:

  • 缓存读取价格
  • 缓存写入价格
  • 长上下文阶梯价格
  • 思考 Token
  • Batch 批处理折扣
  • Priority 优先服务
  • 不同地区的部署价格
  • 限时活动和分时折扣

本文整理了目前国内外主流厂商最新、最常用的模型,重点对比官方 API 价格、缓存价格、模型定位和适用场景。

本文价格统计截至 2026 年 7 月 21 日。
除特别说明外,价格均为每 100 万 Token,即每 1M Tokens 的价格。
本文比较的是厂商官方 API,不是 ChatGPT、Claude、Gemini 等网页会员订阅价格,也不包括第三方中转站加价。


一、先看懂大模型 API 是怎么收费的

一次普通模型请求的费用,通常可以简化为:

1
2
3
4
请求费用 =
输入 Token 数量 ÷ 1,000,000 × 输入单价
+
输出 Token 数量 ÷ 1,000,000 × 输出单价

例如,某模型输入价格为 2 美元、输出价格为 10 美元,一次请求消耗:

  • 输入 10 万 Token
  • 输出 2 万 Token

那么费用为:

1
2
3
4
5
100,000 ÷ 1,000,000 × 2
+
20,000 ÷ 1,000,000 × 10
=
0.4 美元

1. 输入价格

输入包括用户发送的内容、System Prompt、历史对话、工具定义、知识库文档以及图片转换后的 Token 等。

对于 Agent、Claude Code、Codex、长文档分析等场景,输入 Token 往往远高于输出 Token。

2. 输出价格

输出包括模型最终回答,以及部分厂商计入输出用量的思考 Token。

输出价格通常是输入价格的 4~10 倍。对于深度推理、代码生成和长报告场景,输出价格往往才是主要成本。

3. 缓存读取

当大量请求重复携带相同的 System Prompt、工具列表、代码库或知识库内容时,可以使用上下文缓存。

缓存命中后,这部分输入不再按完整输入价格收费,而是按照更低的缓存读取价格收费。

4. 缓存写入

部分厂商首次创建缓存时会额外收费,例如:

  • OpenAI:GPT-5.6 缓存写入通常是普通输入价格的 1.25 倍
  • Anthropic:5 分钟缓存写入为输入价格的 1.25 倍,1 小时缓存写入为 2 倍
  • MiniMax:部分模型单独收取缓存写入费用

因此,缓存不一定每次都省钱。缓存内容至少需要被重复使用几次,才能覆盖首次创建成本。

5. 不同厂商的 Token 不能直接等同

即使两个模型的输入价格都是 2 美元,也不代表处理同一段文本的最终费用完全相同,因为不同厂商使用的分词器不同。

Anthropic 特别说明,Claude Opus 4.7 及之后的部分新模型采用了新版分词器,同一段文本产生的 Token 数量可能比旧版多约 30%,实际比例取决于内容。


二、国外主流模型价格对比

1. OpenAI:GPT-5.6 Sol、Terra、Luna

OpenAI 最新的 GPT-5.6 系列分为三个档位:

  • GPT-5.6 Sol:旗舰能力
  • GPT-5.6 Terra:能力和成本平衡
  • GPT-5.6 Luna:面向高并发、成本敏感场景

三款模型都提供约 105 万 Token 上下文窗口和最高 12.8 万 Token 输出。OpenAI 官方建议复杂推理和编程从 Sol 开始,常规生产任务使用 Terra,高并发低成本任务使用 Luna。

标准短上下文价格

模型 输入 缓存读取 缓存写入 输出
GPT-5.6 Sol $5.00 $0.50 $6.25 $30.00
GPT-5.6 Terra $2.50 $0.25 $3.125 $15.00
GPT-5.6 Luna $1.00 $0.10 $1.25 $6.00

长上下文价格

模型 输入 缓存读取 缓存写入 输出
GPT-5.6 Sol $10.00 $1.00 $12.50 $45.00
GPT-5.6 Terra $5.00 $0.50 $6.25 $22.50
GPT-5.6 Luna $2.00 $0.20 $2.50 $9.00

此外,OpenAI 的 Batch 和 Flex 模式价格通常为标准价格的 50%;Priority 优先服务价格则明显高于标准服务。

GPT-5.6 Sol

Sol 是 GPT-5.6 系列的旗舰模型,适合:

  • 复杂代码开发
  • 大型代码库分析
  • 深度研究
  • 高难度推理
  • 多步骤 Agent
  • 计算机操作
  • 专业知识工作

它的主要问题是输出价格较高。生成 100 万输出 Token 需要 30 美元,在长上下文档位下还会升至 45 美元。

GPT-5.6 Terra

Terra 的官方定位是平衡智能和成本,可以理解为 GPT-5.6 系列的主力生产模型。

其价格正好约为 Sol 的一半,但仍保留 105 万 Token 上下文和 12.8 万 Token 最大输出,比较适合:

  • AI 编程助手
  • 普通 Agent
  • 文档分析
  • 数据处理
  • 企业知识库
  • 对话机器人

对于大多数生产环境,Terra 通常比直接全面使用 Sol 更容易控制成本。

GPT-5.6 Luna

Luna 面向成本敏感和高并发任务,价格只有:

  • 输入 1 美元
  • 输出 6 美元
  • 缓存读取 0.1 美元

适合分类、信息提取、摘要、格式转换、简单问答和子代理任务。


2. Anthropic:Claude Fable 5、Opus 4.8、Sonnet 5、Haiku 4.5

Anthropic 当前的主要模型分为四档:

模型 普通输入 缓存写入 5 分钟 缓存写入 1 小时 缓存读取 输出
Claude Fable 5 $10.00 $12.50 $20.00 $1.00 $50.00
Claude Opus 4.8 $5.00 $6.25 $10.00 $0.50 $25.00
Claude Sonnet 5 $2.00 $2.50 $4.00 $0.20 $10.00
Claude Haiku 4.5 $1.00 $1.25 $2.00 $0.10 $5.00

Claude Sonnet 5 当前为推广价格。优惠持续到 2026 年 8 月 31 日,从 2026 年 9 月 1 日起将恢复为:

  • 输入:3 美元
  • 5 分钟缓存写入:3.75 美元
  • 1 小时缓存写入:6 美元
  • 缓存读取:0.3 美元
  • 输出:15 美元

Anthropic 的 Message Batches API 通常可以节省 50%。

Claude Fable 5

Fable 5 是 Anthropic 面向长时间运行 Agent 的最高能力公开模型,提供 100 万 Token 上下文和 12.8 万 Token 最大输出。

适合:

  • 超复杂 Agent
  • 长时间自主任务
  • 高难度代码工程
  • 高价值企业工作流
  • 对准确率要求极高的专业任务

但它也是目前主流文本模型中价格最高的一档:输入 10 美元、输出 50 美元。

Claude Opus 4.8

Opus 4.8 面向复杂智能体编程和企业工作,是 Claude 系列较常规的高端选择。

它比 Fable 5 便宜一半,仍然提供 100 万 Token 上下文,适合:

  • Claude Code
  • 大型代码项目
  • 多轮工具调用
  • 企业 Agent
  • 长文档推理
  • 复杂工作流自动化

Claude Sonnet 5

Sonnet 5 的官方定位是速度和智能之间的最佳组合。

在当前推广价下,它的输入和输出分别为 2 美元和 10 美元,价格甚至低于上一代 Sonnet 的标准价,是现阶段 Claude 系列中最适合大规模生产使用的型号。

不过部署时需要注意:2026 年 9 月 1 日恢复标准价后,整体费用将上涨 50%。

Claude Haiku 4.5

Haiku 4.5 是 Claude 系列速度最快、价格最低的模型,适合:

  • 高频对话
  • 数据提取
  • 文本分类
  • 简单代码处理
  • 子代理
  • 低延迟接口

Anthropic 官方将 Fable 5 定位为最高能力模型,Opus 4.8 定位为复杂编程和企业工作,Sonnet 5 定位为速度与智能的平衡,Haiku 4.5 定位为最快的轻量模型。前三者为 100 万上下文,Haiku 4.5 为 20 万上下文。

Claude Mythos 5 虽然已经存在,价格与 Fable 5 相同,但它属于 Project Glasswing 的邀请制防御性网络安全模型,不提供普通用户自助申请,因此没有列入常用模型对比。


3. Google:Gemini 3.1 Pro、Gemini 3.5 Flash、Gemini 3.1 Flash-Lite

Google 的模型价格层级比较清晰,但需要特别注意长上下文阶梯价和缓存存储费。

模型 输入 缓存读取 输出
Gemini 3.1 Pro Preview,输入不超过 200K $2.00 $0.20 $12.00
Gemini 3.1 Pro Preview,输入超过 200K $4.00 $0.40 $18.00
Gemini 3.5 Flash $1.50 $0.15 $9.00
Gemini 3.1 Flash-Lite $0.25 $0.025 $1.50

Google 明确说明,表格中的输出价格包含模型产生的思考 Token。

Gemini 3.1 Pro Preview

Gemini 3.1 Pro Preview 是 Google 当前的高性能模型,适合:

  • 多模态理解
  • 复杂 Agent
  • 编程
  • 长文档分析
  • 高难度推理

但它存在明显的阶梯计费:

  • 输入不超过 20 万 Token:2 美元输入、12 美元输出
  • 输入超过 20 万 Token:4 美元输入、18 美元输出

也就是说,一旦请求跨过 20 万 Token,输入价格翻倍,输出价格也会增加 50%。

Gemini 3.5 Flash

Gemini 3.5 Flash 是 Google 面向速度和高智能结合的主力模型:

  • 输入 1.5 美元
  • 输出 9 美元
  • 缓存读取 0.15 美元

它的 Batch 和 Flex 模式输入、输出价格均为标准价格的一半。

适合搜索增强问答、Agent、日常多模态理解、内容处理和中高并发业务。

Gemini 3.1 Flash-Lite

Flash-Lite 是 Google 当前最便宜的主流模型:

  • 文本、图片和视频输入:0.25 美元
  • 音频输入:0.5 美元
  • 输出:1.5 美元
  • 文本缓存读取:0.025 美元

它适合翻译、分类、信息提取、简单数据处理和高并发 Agent 子任务。Batch 模式下还可以进一步降至输入 0.125 美元、输出 0.75 美元。

Google 缓存的额外成本

Google 除了收取缓存 Token 的读取费用,还可能收取缓存存储费用。例如:

  • Gemini 3.5 Flash:每小时、每百万缓存 Token 1 美元
  • Gemini 3.1 Flash-Lite:每小时、每百万缓存 Token 1 美元
  • Gemini 3.1 Pro Preview:每小时、每百万缓存 Token 4.5 美元

因此,Google 缓存更适合生命周期明确、重复调用频繁的内容,不适合盲目长期保存大量低复用数据。


4. SpaceXAI:Grok 4.5

xAI 当前将文本、对话和代码任务集中到 Grok 4.5 上,没有再提供复杂的多档文本模型列表。

模型 输入 输出 上下文
Grok 4.5 $2.00 $6.00 500K

Grok 4.5 支持可配置推理,官方将其定位为代码、聊天和 Agent 工具调用的统一旗舰模型。

从价格看,Grok 4.5 的特点比较突出:

  • 输入价格与 Claude Sonnet 5 推广价相同
  • 输出价格低于 GPT-5.6 Terra、Claude Sonnet 5 和 Gemini 3.5 Flash
  • 没有复杂的旗舰、Mini、Nano 多档选择

它比较适合希望使用一个统一模型完成代码、对话和工具调用,同时不想维护复杂模型路由的项目。


三、国内主流模型价格对比

1. DeepSeek:DeepSeek V4 Flash 与 V4 Pro

DeepSeek 最新 API 模型已经升级为 V4 系列。

模型 缓存命中输入 缓存未命中输入 输出 上下文 最大输出
DeepSeek V4 Flash ¥0.02 ¥1.00 ¥2.00 1M 384K
DeepSeek V4 Pro ¥0.025 ¥3.00 ¥6.00 1M 384K

两款模型都支持思考和非思考模式、JSON、工具调用与前缀续写。

DeepSeek V4 Flash

V4 Flash 是低成本、高并发型号:

  • 普通输入 1 元
  • 输出 2 元
  • 缓存命中只需要 0.02 元
  • 官方并发限制高于 Pro

适合:

  • 普通聊天
  • 高频 API
  • 内容处理
  • 信息提取
  • 低成本推理
  • 大规模中转站
  • 简单 Agent

DeepSeek V4 Pro

V4 Pro 的输入和输出分别为 3 元和 6 元,适合:

  • 复杂推理
  • 编程
  • 长上下文
  • 高质量 Agent
  • 对能力要求更高的生产任务

虽然 Pro 的普通输入价格是 Flash 的 3 倍,但输出价格也只有 6 元,仍明显低于多数国内外旗舰模型。

旧模型名称即将弃用

deepseek-chat 和 deepseek-reasoner 将于北京时间 2026 年 7 月 24 日 23:59 弃用。

兼容映射关系为:

  • deepseek-chat → DeepSeek V4 Flash 非思考模式
  • deepseek-reasoner → DeepSeek V4 Flash 思考模式

新项目应直接使用 deepseek-v4-flash 或 deepseek-v4-pro。


2. 阿里千问:Qwen3.7 Max、Qwen3.7 Plus、Qwen3.6 Flash

千问的价格是本文最复杂的一组,因为它会受到以下因素影响:

  • 服务部署地区
  • 输入上下文长度
  • 是否使用 Batch
  • 是否命中上下文缓存
  • 当前是忙时还是错峰时段
  • 限时折扣活动

为了保证不同地区价格可以直接核验,下面使用阿里云官方页面中的全球部署美元价格。

Qwen3.7 Max

时段 输入 输出
官方原价 $1.65 $4.951
错峰活动价 约 $0.33 约 $0.9902
忙时活动价 约 $0.825 约 $2.4755

错峰时段为北京时间 22:00 至次日 08:00。官方页面显示,Qwen3.7 Max 当前错峰按原价 2 折、忙时按原价 5 折计费。

Qwen3.7 Max 支持思考和非思考模式,最大输入档位达到 100 万 Token,适合复杂推理、代码、Agent 和企业知识工作。

Qwen3.7 Plus

输入不超过 256K

时段 输入 输出
官方原价 $0.276 $1.101
错峰活动价 约 $0.1104 约 $0.4404
忙时活动价 约 $0.2208 约 $0.8808

输入超过 256K、不超过 1M

时段 输入 输出
官方原价 $0.826 $3.301
错峰活动价 约 $0.3304 约 $1.3204
忙时活动价 约 $0.6608 约 $2.6408

Qwen3.7 Plus 当前错峰按原价 4 折、忙时按原价 8 折。它同时支持思考和非思考模式,适合通用对话、Agent、视觉交互和大多数生产业务。

Qwen3.6 Flash

单次请求输入长度 输入 输出
不超过 256K $0.25 $1.50
超过 256K、不超过 1M $1.00 $4.00

Qwen3.6 Flash 适合高并发、摘要、分类、轻量对话和信息提取。

但需要特别注意:当单次输入超过 256K 后,输入价格会从 0.25 美元上涨到 1 美元,输出价格也会从 1.5 美元上涨到 4 美元。

千问多数模型还支持上下文缓存折扣,Batch 调用一般为实时调用价格的一半。活动价格、地区价格和人民币控制台价格可能继续调整,实际部署时必须按所选区域核对。


3. Moonshot AI:Kimi K3、K2.7 Code、K2.6

模型 缓存命中输入 普通输入 输出 上下文
Kimi K3 ¥2.00 ¥20.00 ¥100.00 1M
Kimi K2.7 Code ¥1.30 ¥6.50 ¥27.00 256K
Kimi K2.6 ¥1.10 ¥6.50 ¥27.00 256K

以上价格来自 Kimi 官方开放平台。

Kimi K3

K3 是 Kimi 当前的旗舰模型,面向:

  • 长程编程
  • 端到端知识工作
  • 深度推理
  • 复杂工具调用
  • 长时间 Agent

它提供 100 万 Token 上下文,并始终启用推理,可通过 reasoning_effort 设置 low、high 或 max。

K3 的能力定位较高,但价格同样明显高于大多数国产模型:

  • 普通输入 20 元
  • 输出 100 元
  • 缓存读取 2 元

因此,更适合高价值复杂任务,而不是全面替代低成本模型处理简单请求。

Kimi K2.7 Code

K2.7 Code 是 Kimi 的编程专用模型,支持多模态和 256K 上下文,适合:

  • 代码生成
  • 长代码库分析
  • 编程 Agent
  • Claude Code 类工具
  • 多步骤软件工程任务

它和 K2.6 的普通输入、输出价格相同,但缓存命中价格略高。

Kimi K2.6

K2.6 是通用模型,支持文本、图片和视频输入,同时支持思考和非思考模式。

它比较适合:

  • 通用 Agent
  • 视觉理解
  • 对话
  • 编程
  • 文档处理
  • 综合业务任务

Kimi 自动上下文缓存

Kimi 的上下文缓存会自动启用,不需要手动创建缓存 ID,也不需要手动管理 TTL。

当请求的 Prompt 超过 256 Token,并且后续请求存在相同前缀时,才可能命中前缀缓存。


4. MiniMax:MiniMax M3 与 M2.7

MiniMax M3 标准服务

单次输入长度 输入 缓存读取 输出
不超过 512K ¥2.10 ¥0.42 ¥8.40
超过 512K ¥4.20 ¥0.84 ¥16.80

以上为 MiniMax 官方标注的永久五折价格。

MiniMax M3 提供 100 万 Token 上下文,支持原生多模态、代码、Agent、工具调用和长上下文任务。

MiniMax M2.7 系列

模型 输入 缓存读取 缓存写入 输出
MiniMax M2.7 ¥2.10 ¥0.42 ¥2.625 ¥8.40
MiniMax M2.7 Highspeed ¥4.20 ¥0.42 ¥2.625 ¥16.80

M2.7 提供约 20.48 万 Token 上下文:

  • 普通版输出速度约 60 TPS
  • Highspeed 输出速度约 100 TPS
  • Highspeed 能力不变,但价格约为普通版两倍

MiniMax 还提供 Priority 优先服务,价格为标准价格的 1.5 倍,用于提高请求准入优先级、降低失败率。


四、典型请求费用模拟

下面统一假设一次请求消耗:

  • 输入:10 万 Token
  • 输出:2 万 Token
  • 不计算缓存
  • 不计算联网搜索、代码执行等工具费用
  • 不计算税费和第三方渠道加价

国外模型

模型 单次预计费用
Claude Fable 5 $2.000
GPT-5.6 Sol $1.100
Claude Opus 4.8 $1.000
GPT-5.6 Terra $0.550
Gemini 3.1 Pro Preview $0.440
Claude Sonnet 5,推广价 $0.400
Gemini 3.5 Flash $0.330
Grok 4.5 $0.320
GPT-5.6 Luna $0.220
Claude Haiku 4.5 $0.200
Gemini 3.1 Flash-Lite $0.055

这里比较的是价格,不代表模型能力排名。

国内人民币计价模型

模型 单次预计费用
Kimi K3 ¥4.000
Kimi K2.7 Code ¥1.190
Kimi K2.6 ¥1.190
MiniMax M2.7 Highspeed ¥0.756
DeepSeek V4 Pro ¥0.420
MiniMax M3,不超过 512K ¥0.378
MiniMax M2.7 ¥0.378
DeepSeek V4 Flash ¥0.140

千问全球部署活动价

模型 错峰费用 忙时费用
Qwen3.7 Max 约 $0.0528 约 $0.1320
Qwen3.7 Plus,不超过 256K 约 $0.0198 约 $0.0397
Qwen3.6 Flash,不超过 256K $0.0550 $0.0550

千问当前活动折扣力度很大,但活动价不应被当成永久价格。做长期成本预算时,应同时保留官方原价方案。


五、不同场景应该怎么选?

1. 复杂任务和最高能力档

可以优先测试各厂商的旗舰型号:

  • GPT-5.6 Sol
  • Claude Fable 5
  • Claude Opus 4.8
  • Gemini 3.1 Pro Preview
  • Kimi K3
  • Qwen3.7 Max

这些模型适合复杂编程、深度研究、长时间 Agent 和高价值专业任务,但不适合无差别承接所有普通请求。

2. 能力和成本平衡

比较适合作为生产环境主力模型的有:

  • GPT-5.6 Terra
  • Claude Sonnet 5
  • Gemini 3.5 Flash
  • Grok 4.5
  • DeepSeek V4 Pro
  • Qwen3.7 Plus
  • Kimi K2.6
  • MiniMax M3

其中 Claude Sonnet 5 和千问当前存在活动价格,长期部署时需要考虑活动结束后的价格变化。

3. 高并发和简单任务

适合分类、摘要、提取、格式化和普通客服的有:

  • GPT-5.6 Luna
  • Claude Haiku 4.5
  • Gemini 3.1 Flash-Lite
  • DeepSeek V4 Flash
  • Qwen3.6 Flash

这类任务不应默认调用最贵的旗舰模型,否则大量成本会浪费在简单请求上。

4. 编程与 Agent

可以重点测试:

  • GPT-5.6 Sol
  • GPT-5.6 Terra
  • Claude Opus 4.8
  • Claude Sonnet 5
  • Grok 4.5
  • Kimi K2.7 Code
  • Qwen3.7 Max
  • MiniMax M3

实际选择时不能只看单次问答效果,还需要测试:

  • 工具调用成功率
  • 长任务是否中断
  • 是否会重复调用工具
  • 代码修改是否完整
  • 上下文压缩能力
  • 首 Token 延迟
  • 输出速度
  • 大并发稳定性

六、做 API 中转站时最容易踩的价格坑

1. 不要只设置一个总倍率

同一个模型的输入、输出、缓存读取和缓存写入价格差异非常大。

例如 GPT-5.6 Sol:

  • 输入:5 美元
  • 缓存读取:0.5 美元
  • 缓存写入:6.25 美元
  • 输出:30 美元

如果全部使用同一个固定倍率,可能出现:

  • 缓存读取利润过高
  • 输出 Token 倒贴
  • 缓存写入未计费
  • 长上下文请求亏损

正确做法是分别配置:

1
2
3
4
5
6
输入倍率
输出倍率
缓存读取倍率
缓存写入倍率
长上下文倍率
Priority 服务倍率

2. 必须区分标准价和活动价

Claude Sonnet 5、Qwen3.7 Max、Qwen3.7 Plus 等模型当前都有推广或分时价格。

中转站不能只保存当前活动价,否则活动结束后,上游恢复原价,而下游仍按旧价收费,就可能直接亏损。

3. 长上下文必须单独计价

OpenAI、Google、千问和 MiniMax 都存在长上下文阶梯价格。

常见错误是只根据总 Token 数统计,却没有根据单次请求输入长度切换价格档位。

4. 思考 Token 可能显著增加输出成本

用户看到的最终回答可能只有几千 Token,但模型内部可能产生了大量思考 Token。

尤其是深度推理、代码 Agent 和多轮工具调用场景,实际计费输出量可能远高于最终展示文本。

5. 缓存读取不能错误地计入普通输出

缓存读取属于输入侧成本,不能算成输出 Token,也不能再同时计入普通输入,否则会重复收费。

建议日志至少单独保存:

1
2
3
4
5
6
7
prompt_tokens
completion_tokens
cache_read_tokens
cache_creation_tokens
cache_creation_tokens_5m
cache_creation_tokens_1h
reasoning_tokens

6. 第三方云平台价格可能不同

同一个 Claude 模型通过 Anthropic 官方、Amazon Bedrock、Google Cloud 或其他云平台调用时,价格、地区附加费、模型 ID 和缓存规则可能不同。

因此,中转站配置价格时应以实际上游渠道为单位,而不是只根据模型名称设置一个全局价格。


七、最终总结

从价格角度看,目前大致可以分为以下几档:

国外高端旗舰

  • Claude Fable 5
  • GPT-5.6 Sol
  • Claude Opus 4.8

能力定位最高,但输出价格也最高。

国外主力性价比

  • GPT-5.6 Terra
  • Claude Sonnet 5
  • Gemini 3.5 Flash
  • Grok 4.5

适合作为代码、Agent、对话和知识工作的生产主力。

国外低成本高并发

  • Gemini 3.1 Flash-Lite
  • Claude Haiku 4.5
  • GPT-5.6 Luna

适合简单任务、子代理、分类、摘要和数据提取。

国产低成本模型

  • DeepSeek V4 Flash
  • DeepSeek V4 Pro
  • MiniMax M3
  • Qwen3.6 Flash
  • Qwen3.7 Plus

整体价格明显低于海外旗舰模型,更适合大规模调用和成本敏感业务。

国产高能力与长程 Agent

  • Kimi K3
  • Qwen3.7 Max
  • Kimi K2.7 Code
  • MiniMax M3
  • DeepSeek V4 Pro

更适合复杂编程、工具调用、长上下文和 Agent 场景。

最终选择模型时,不应只比较“每百万 Token 多少钱”,而应该同时比较:

  1. 完成同一任务实际消耗多少 Token
  2. 模型是否一次完成,还是需要重复重试
  3. 工具调用和长任务成功率
  4. 缓存命中率
  5. 输出速度和首 Token 延迟
  6. 长上下文是否触发阶梯价格
  7. 活动结束后的长期成本
  8. 实际上游渠道是否存在额外加价

真正便宜的模型,不是单价最低的模型,而是能够以较低总成本稳定完成任务的模型。