聊天补全
根据一组消息生成模型响应。
聊天补全接口根据一组有顺序的消息生成模型响应。本页以非流式文本请求为例。
请求端点
POST https://api.vergora.ai/v1/chat/completions请求需要以下标头:
Authorization: Bearer YOUR_VERGORA_API_KEY
Content-Type: application/json请求正文
{
"model": "gpt-5.6-sol",
"messages": [
{
"role": "user",
"content": "请简洁解释统一模型 API。"
}
],
"stream": false
}常用字段
| 字段 | 是否必填 | 说明 |
|---|---|---|
model | 是 | 从模型目录复制的 Model ID |
messages | 是 | 按对话顺序排列的消息数组 |
messages[].role | 是 | 消息角色;可用角色以模型说明为准 |
messages[].content | 是 | 文本或模型支持的内容结构 |
temperature | 否 | 控制采样;范围和默认值以模型说明为准 |
max_tokens | 否 | 输出上限;字段支持情况以模型说明为准 |
stream | 否 | 是否使用流式输出 |
不要向模型传递未经支持的可选参数。第一次验证时,建议只使用必填字段和 stream: false。
读取响应
{
"id": "example-response-id",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "这是一个示例回复。"
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 30,
"completion_tokens": 20,
"total_tokens": 50
}
}通常从 choices[0].message.content 读取文本。检查 finish_reason,并使用 usage 核对输入和输出用量。示例字段用于说明兼容结构,实际响应以接口返回为准。
多轮对话
应用需要在后续请求中按顺序携带必要的历史消息。控制历史长度,避免重复内容或超出模型上下文限制。包含敏感信息时,只发送任务所需的最少内容。
需要持续接收内容时,请阅读“流式输出”。