AICraft 技术团队整理 · 海南艾创矩阵科技有限公司
2025 年大家还在为 128K 够不够用吵架,2026 年满屏都是"1M 上下文"和"2M、20M"的营销话术。但真上手才发现:把 100 万字塞进提示词 ≠ 模型就能好好用那 100 万字,而且长上下文不是免费的——单位 token 更贵、一次请求更贵、慢更久。这篇把"上下文到底怎么选"讲透。
| 模型 | 上下文 | 输入 ¥/M | 输出 ¥/M | 备注 |
|---|---|---|---|---|
| DeepSeek-V3.2 | 128K | 1.9 | 3.0 | 代码/通用均衡,短任务性价比高 |
| gpt-oss-120b | 128K | 1.03 | 5.17 | 开源系低价 |
| Qwen3-Next-80B-A3B | 131K | 1.0 | 10.0 | MoE 高效 |
| Doubao-Seed-2.1-turbo | 256K | 3.0 | 15.0 | 中档够用 |
| Claude-4.5-Haiku | 200K | 6.9 | 34.5 | 系内最小最便宜 |
| GPT-5.4-Mini | 400K | 5.17 | 31.05 | 400K 档代表 |
| Kimi-K2.6 | 262K | 6.17 | 27.0 | 中文长文均衡 |
| 模型 | 上下文 | 输入 ¥/M | 输出 ¥/M | 备注 |
|---|---|---|---|---|
| Gemini-2.5-Flash-Lite | 1.0M | 0.69 | 2.76 | 1M 档最便宜,量大首选 |
| GLM-5.3-Flash | 1.0M | 0.4 | 1.4 | 全场最低单价且 1M |
| DeepSeek-V4-Flash | 1.0M | 0.95 | 2.0 | 1M + 低输入价 |
| Qwen3.5-Plus | 1.0M | 0.76 | 16.8 | 输入极便宜、适合灌文档(输出贵) |
| Claude-Sonnet-5 | 1.0M | 15.59 | 77.97 | 1M 且写作质量第一梯队 |
| GPT-5.4 | 1.1M | 17.25 | 103.5 | 破 1M 的旗舰 |
| GPT-5.6-Luna | 1.1M | 1.52 | 9.15 | 1.1M 里最便宜 |
| Gemini-3.7-Flash | 1.0M | 5.72 | 28.59 | 新一代均衡 |
| 模型 | 上下文 | 输入 ¥/M | 输出 ¥/M | 备注 |
|---|---|---|---|---|
| Grok-4.1-Fast-Non-Reasoning | 2.0M | 1.52 | 3.81 | 2M 档 |
| Grok-4.1-Fast-Reasoning | 20.0M | 1.52 | 3.81 | 目前标注最大的窗口 |
20M 看着吓人,实际"真需要 20M"的任务极少(≈ 四千万字中文)。大多数 1M 就溢出。先想清楚你的文档到底多大。
很多人以为长上下文 = 免费多用。错。一次把整份长文档放进提示词,输入 token = 文档长度,付费 = 文档 token × 输入单价:
| 场景 | 模型 | 一次输入成本估算 |
|---|---|---|
| 100 万 tokens 文档 | Qwen3.5-Plus(0.76 输入) | ≈ ¥760/次 |
| 100 万 tokens 文档 | Gemini-2.5-Flash-Lite(0.69) | ≈ ¥690/次 |
| 100 万 tokens 文档 | Claude-Sonnet-5(15.59) | ≈ ¥15,590/次 |
| 10 万 tokens 文档 | Qwen3.5-Plus | ≈ ¥76/次 |
结论很反直觉:长文档真正贵的不是"上下文能力",是"你喂进去的 token 总量"。所以:
看三点:
聚合接口一个 Key 接入 88+ 大模型,每模型都标了真实上下文窗口与输入/输出单价(见在线模型目录),方便你按"任务长度 × 单价"自己算账再选。想省事的直接 model="auto",Auto Router 会按任务类型在质量/速度/成本间自动选——长文档任务自动落到大窗口档,短任务不会浪费在贵模型上。可用性见状态页。
关联:价格横向对照见 /model-api-guide.html;完整模型目录(含每模型上下文/输入/输出价)见 /models.html。