大模型上下文窗口:1M 是噱头吗?长文档到底该用谁(2026-09 对照)

AICraft 技术团队整理 · 海南艾创矩阵科技有限公司

数据采集:2026-09-04 · 口径:上下文长度为各模型官方刊例标注,价格为人民币元 / 百万 tokens(¥/M)· 页面性质:选型参考指南,非投放广告。完整清单见在线模型目录。

2025 年大家还在为 128K 够不够用吵架,2026 年满屏都是"1M 上下文"和"2M、20M"的营销话术。但真上手才发现:把 100 万字塞进提示词 ≠ 模型就能好好用那 100 万字,而且长上下文不是免费的——单位 token 更贵、一次请求更贵、慢更久。这篇把"上下文到底怎么选"讲透。

一、先给结论(赶时间只看这条)

  1. 1M 上下文的正确用法是"整包输入、一次问完":完整合同、整仓代码、整本年报——让模型一次读完再回答。价值在省掉你手搓切片的功夫。
  2. 但"输入 100 万字"本身要花钱:单位是 ¥/M tokens,喂 1M 进上下文 ≈ 付 1 次"输入价×1"的钱。选模型前先算这笔账,别被"1M 免切"冲昏头。
  3. 长上下文 ≠ 长推理能力强:写作/推理要另看模型本身的档位。上下文只是"能装多少",质量是另一回事。
  4. 短任务永远别用长上下文模型:同样的活儿,1M 模型的单价通常远高于 128K/256K 版。

二、主流模型上下文窗口与价格对照(2026-09)

下表上下文列为各模型官方标注的最大输入窗口;价格为 ¥/M tokens。只摘代表型号,完整清单见在线模型目录

128K~400K(日常主力档)

模型上下文输入 ¥/M输出 ¥/M备注
DeepSeek-V3.2128K1.93.0代码/通用均衡,短任务性价比高
gpt-oss-120b128K1.035.17开源系低价
Qwen3-Next-80B-A3B131K1.010.0MoE 高效
Doubao-Seed-2.1-turbo256K3.015.0中档够用
Claude-4.5-Haiku200K6.934.5系内最小最便宜
GPT-5.4-Mini400K5.1731.05400K 档代表
Kimi-K2.6262K6.1727.0中文长文均衡

1M+(超长文档档)

模型上下文输入 ¥/M输出 ¥/M备注
Gemini-2.5-Flash-Lite1.0M0.692.761M 档最便宜,量大首选
GLM-5.3-Flash1.0M0.41.4全场最低单价且 1M
DeepSeek-V4-Flash1.0M0.952.01M + 低输入价
Qwen3.5-Plus1.0M0.7616.8输入极便宜、适合灌文档(输出贵)
Claude-Sonnet-51.0M15.5977.971M 且写作质量第一梯队
GPT-5.41.1M17.25103.5破 1M 的旗舰
GPT-5.6-Luna1.1M1.529.151.1M 里最便宜
Gemini-3.7-Flash1.0M5.7228.59新一代均衡

2M~20M(特殊场景:巨量上下文)

模型上下文输入 ¥/M输出 ¥/M备注
Grok-4.1-Fast-Non-Reasoning2.0M1.523.812M 档
Grok-4.1-Fast-Reasoning20.0M1.523.81目前标注最大的窗口
20M 看着吓人,实际"真需要 20M"的任务极少(≈ 四千万字中文)。大多数 1M 就溢出。先想清楚你的文档到底多大。

三、算一笔真实的账:喂 1M token 一次要多少钱

很多人以为长上下文 = 免费多用。错。一次把整份长文档放进提示词,输入 token = 文档长度,付费 = 文档 token × 输入单价:

场景模型一次输入成本估算
100 万 tokens 文档Qwen3.5-Plus(0.76 输入)¥760/次
100 万 tokens 文档Gemini-2.5-Flash-Lite(0.69)¥690/次
100 万 tokens 文档Claude-Sonnet-5(15.59)¥15,590/次
10 万 tokens 文档Qwen3.5-Plus¥76/次

结论很反直觉:长文档真正贵的不是"上下文能力",是"你喂进去的 token 总量"。所以:

四、省钱四步(可直接抄)

  1. 先剪后喂:把无关的日志、重复段落、图片转文字垃圾删掉再进上下文。剪掉一半 token = 省一半钱。
  2. 能用摘要就别整包:超长文档先让模型出结构化摘要,再带着摘要做问答——比反复全量喂便宜一个数量级。
  3. 缓存重复前缀:对话开头那大段固定背景(公司规范/角色设定)会反复计费,用支持前缀缓存的调用方式,重复部分只付一次。
  4. 短任务锁短窗口模型:产品里按任务长度路由——短问答走 128K/256K 档,只有真长文档才放行到 1M 档。省下的钱比任何调价都多。

五、怎么判断"1M 是不是噱头"

看三点:

  1. 上下文是真窗口还是宣传值:以官方标注 + 实测能稳定处理的上限为准,营销页的"支持 100 万字"经常要打折看。
  2. 长文任务的输出质量:模型在 5 万 token 后还能不能抓住关键信息、不前后矛盾——这靠实测,不靠参数表。
  3. 价格是否随窗口飞涨:同样的窗口,输入价差 20 倍(0.69 vs 15.59)。窗口越大 ≠ 越值得,单价才是真账

六、AICraft 侧怎么做

聚合接口一个 Key 接入 88+ 大模型,每模型都标了真实上下文窗口与输入/输出单价(见在线模型目录),方便你按"任务长度 × 单价"自己算账再选。想省事的直接 model="auto",Auto Router 会按任务类型在质量/速度/成本间自动选——长文档任务自动落到大窗口档,短任务不会浪费在贵模型上。可用性见状态页

附:数据口径与免责

官方上下文与刊例价核对来源(2026-09-04 采集,可按厂商逐一复核):

关联:价格横向对照见 /model-api-guide.html;完整模型目录(含每模型上下文/输入/输出价)见 /models.html