Skip to main content
POST
Chat Completions

Request

Pass your API key as a Bearer token in the Authorization header.

Body

Response

Streaming

Set "stream": true to receive Server-Sent Events (SSE) as tokens are generated:
Each SSE event contains a chat.completion.chunk object:

OpenAI SDK

This endpoint is fully compatible with the OpenAI SDK. Just change the base_url and api_key:

Authorizations

Authorization
string
header
required

Bearer token authentication using ModelsLab API key

Body

application/json
messages
object[]
required

Array of chat messages

model
string

Model ID to use for the completion (e.g. 'Qwen/Qwen2.5-VL-72B-Instruct-together')

max_tokens
integer
default:1000

Maximum number of tokens to generate

Required range: x >= 1
temperature
number
default:1

Sampling temperature (0-2). Higher values make output more random.

Required range: 0 <= x <= 2
top_p
number
default:1

Nucleus sampling parameter

Required range: 0 <= x <= 1
stream
boolean
default:false

Whether to stream partial results as Server-Sent Events

presence_penalty
number
default:0

Penalize new tokens based on whether they appear in the text so far

Required range: -2 <= x <= 2
frequency_penalty
number
default:0

Penalize new tokens based on their frequency in the text so far

Required range: -2 <= x <= 2

Response

Chat completion response

id
string

Unique completion ID

object
enum<string>
Available options:
chat.completion
created
integer

Unix timestamp

model
string

Model used

choices
object[]
usage
object