QiyuanHub
首页模型 & 定价接入文档

QiyuanHub

社区私有算力与统一 API 网关,为超级个体和小团队提供本地可控的模型接入能力。

产品

  • 模型定价
  • 接入文档
  • 控制台

合规

  • 用户协议
  • 隐私政策
  • API 使用条款

账号

  • 开始接入
  • 登录

社区算力平台 · 数据不出园区

© 2026 QiyuanHub. All rights reserved.

·陕ICP备2026020061号-1

快速开始

  • 30 秒快速验证
  • 接口与协议
  • Node.js 环境安装
  • CC Switch 统一配置
  • Claude Code 配置
  • Gemini CLI 配置
  • Codex (OpenAI) 配置

外部接入

  • OpenCode 配置
  • Hermes 配置
  • WorkBuddy 配置
  • Trae 外接配置
  • 腾讯云 OpenClaw
  • 飞书 / n8n / Coze

进阶玩法

  • OpenClaw 部署教程
  • ChatBox 接入教程

能力指南

  • 图片理解
  • 视频生成
  • 思考强度设置
  • 联网搜索

其他

  • 接入排查
  • 常见问题
Docs/能力指南/思考强度设置

思考强度设置

deepseek-v4.1 默认在回答前先思考(档位 high)。用 reasoning_effort 调深浅或关闭;思考内容按输出 token 计费。

01

这是什么

deepseek-v4.1 在给出答案前会先做一段内部推演,再写正文。平台按模型官方默认行为提供:不传任何参数时思考是开着的,档位为 high。推演越深,耗时越长、消耗的 token 越多;简单问答、批量处理、对时延敏感的自动化流程建议降档或关闭。

思考内容不会出现在正文里(返回在 reasoning_content 字段),但它会计入输出 token 并按输出价计费。
02

如何设置

在请求体里加上 reasoning_effort 即可。不传该参数时按模型默认(high)处理。

1. 在请求中指定档位

curl https://api.qiyuanapi.cc/v1/chat/completions \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4.1",
    "messages": [{"role": "user", "content": "你的问题"}],
    "reasoning_effort": "low"
  }'

2. 关闭思考

{
  "model": "deepseek-v4.1",
  "messages": [{"role": "user", "content": "把这段话翻译成英文:..."}],
  "reasoning_effort": "none"
}
03

档位怎么选

  • none —— 不思考,直接作答。翻译、改写、分类、抽取这类确定性任务用它最快最省
  • low —— 浅推演。日常问答、常规编码,实测多数问题 1 秒内起笔
  • high —— 模型默认档,不传参数即为此档。覆盖绝大多数场景
  • xhigh / max —— 深推演。数学证明、复杂调试、多步规划时使用;耗时与 token 消耗明显上升
  • 客户端发 OpenAI 标准的 minimal / medium 也可以,平台会自动映射为 low / high,不会报错
  • Claude Code 等 Anthropic 协议客户端用 thinking.budget_tokens 控制,平台会翻译成对应档位;不传即为默认开
04

max_tokens 要给够

思考和正文共用一次请求的输出额度。若额度很小,推演还没结束就触及上限,正文会是空的、finish_reason 为 length。

实测:Responses API 里给 max_output_tokens=200 并开着思考,正文为空;给到 800 即正常返回。
  • 开着思考时,max_tokens 建议不低于 4000;xhigh / max 建议 12000 以上
  • 平台内置护栏:使用 xhigh 且 max_tokens 低于 8000 时,会自动抬高到 12000
  • 不传 max_tokens 时由模型按上下文上限兜底,本来就够
  • 只想要短答案又不想等,正确做法是 reasoning_effort: none,而不是把 max_tokens 调小
05

Agent 类应用请特别注意

对需要连续调用几十上百次的自动化流程,单次耗时的稳定性比平均值更重要——任何一次长尾都会累加进任务总时长。这类场景建议显式传 low,需要深度推理的步骤再单独提到 high 或 xhigh。

本页目录

  • 这是什么
  • 如何设置
  • 档位怎么选
  • max_tokens 要给够
  • Agent 类应用请特别注意