思考强度设置
deepseek-v4.1 默认在回答前先思考(档位 high)。用 reasoning_effort 调深浅或关闭;思考内容按输出 token 计费。
01
这是什么
deepseek-v4.1 在给出答案前会先做一段内部推演,再写正文。平台按模型官方默认行为提供:不传任何参数时思考是开着的,档位为 high。推演越深,耗时越长、消耗的 token 越多;简单问答、批量处理、对时延敏感的自动化流程建议降档或关闭。
思考内容不会出现在正文里(返回在 reasoning_content 字段),但它会计入输出 token 并按输出价计费。
02
如何设置
在请求体里加上 reasoning_effort 即可。不传该参数时按模型默认(high)处理。
1. 在请求中指定档位
curl https://api.qiyuanapi.cc/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4.1",
"messages": [{"role": "user", "content": "你的问题"}],
"reasoning_effort": "low"
}'2. 关闭思考
{
"model": "deepseek-v4.1",
"messages": [{"role": "user", "content": "把这段话翻译成英文:..."}],
"reasoning_effort": "none"
}03
档位怎么选
- none —— 不思考,直接作答。翻译、改写、分类、抽取这类确定性任务用它最快最省
- low —— 浅推演。日常问答、常规编码,实测多数问题 1 秒内起笔
- high —— 模型默认档,不传参数即为此档。覆盖绝大多数场景
- xhigh / max —— 深推演。数学证明、复杂调试、多步规划时使用;耗时与 token 消耗明显上升
- 客户端发 OpenAI 标准的 minimal / medium 也可以,平台会自动映射为 low / high,不会报错
- Claude Code 等 Anthropic 协议客户端用 thinking.budget_tokens 控制,平台会翻译成对应档位;不传即为默认开
04
max_tokens 要给够
思考和正文共用一次请求的输出额度。若额度很小,推演还没结束就触及上限,正文会是空的、finish_reason 为 length。
实测:Responses API 里给 max_output_tokens=200 并开着思考,正文为空;给到 800 即正常返回。
- 开着思考时,max_tokens 建议不低于 4000;xhigh / max 建议 12000 以上
- 平台内置护栏:使用 xhigh 且 max_tokens 低于 8000 时,会自动抬高到 12000
- 不传 max_tokens 时由模型按上下文上限兜底,本来就够
- 只想要短答案又不想等,正确做法是 reasoning_effort: none,而不是把 max_tokens 调小
05
Agent 类应用请特别注意
对需要连续调用几十上百次的自动化流程,单次耗时的稳定性比平均值更重要——任何一次长尾都会累加进任务总时长。这类场景建议显式传 low,需要深度推理的步骤再单独提到 high 或 xhigh。