API 参考聊天系列
GPT-6 Astra 调用指南
GPT-6 Astra 的 Chat Completions、Responses API、Codex 配置、参数兼容和超时排查。
gpt-6-astra 与 GPT-5.6 使用相同的 Models Hub 接入地址,也同时支持 Chat Completions 和 Responses API。主要区别不是 URL,而是 GPT-6 的参数约束更严格;Codex、工具调用和多轮推理场景应优先使用 Responses API。
接口与参数
| 场景 | 接口 | 输出上限字段 | 注意事项 |
|---|---|---|---|
| 普通文本对话 | /v1/chat/completions | max_completion_tokens | Models Hub 兼容转换旧客户端的 max_tokens |
| Codex、工具调用、多轮推理 | /v1/responses | max_output_tokens | 推荐方式;Codex 使用此协议 |
不要照搬 GPT-5.6 的所有参数
GPT-6 不支持 temperature、top_p、top_logprobs;使用 Chat Completions 时也不要发送 logprobs。GPT-6 不支持 reasoning_effort = "none",对延迟敏感时从 low 开始。
Responses API(推荐)
curl https://modelsok.com/v1/responses \
-H "Authorization: Bearer $MODELSOK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"input": "用一句话介绍 Models Hub。",
"reasoning": {"effort": "low"},
"max_output_tokens": 256,
"stream": true
}'工具调用、Codex 和需要延续推理上下文的任务都使用 Responses API。完整字段见 Responses 格式。
Chat Completions
curl https://modelsok.com/v1/chat/completions \
-H "Authorization: Bearer $MODELSOK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"messages": [
{"role": "user", "content": "用一句话介绍 Models Hub。"}
],
"reasoning_effort": "low",
"max_completion_tokens": 256,
"stream": true
}'如果旧 SDK 仍发送 max_tokens,Models Hub 会仅对 GPT-6 模型族将其转换为 max_completion_tokens;显式提供的新字段会被保留,不影响其他模型。新代码建议直接使用 max_completion_tokens。
Codex 配置
Codex 的完整安装和验证步骤见 Codex CLI 接入 Models Hub。关键配置如下:
model = "gpt-6-astra"
model_provider = "modelsok"
model_reasoning_effort = "low"
[model_providers.modelsok]
name = "Models Hub"
base_url = "https://modelsok.com/v1"
env_key = "MODELSOK_API_KEY"
wire_api = "responses"
stream_idle_timeout_ms = 300000524 或首 token 很慢
流式返回可以改善等待体感,但不能消除上游服务长时间无响应造成的 524。先将推理强度设为 low 后重试;如果仍然出现,请在 Models Hub 使用日志中记录请求 ID、上游请求 ID、渠道号、首 token 时间和总耗时,再提交给客服定位具体线路。