> ## Индекс документации  
> Получите полный индекс документации по адресу: https://api.vega.chat/docs/llms.txt  
> Используйте этот файл, чтобы узнать о всех доступных страницах перед дальнейшим изучением.

# Параметры

Параметры сэмплинга формируют процесс генерации токенов моделью. Вы можете отправлять любые параметры из следующего списка, а также другие, в API VEGA.

Когда параметр сэмплинга отсутствует в вашем запросе, API VEGA опускает его upstream, а не заменяет жёстко заданным значением, поэтому провайдер применяет своё собственное значение по умолчанию. «По умолчанию», указанное для каждого параметра ниже, — это обычное значение, а не то, которое внедряет API VEGA. Явная передача его (например, `temperature: 1.0`) всё равно будет переслана и может отличаться от его опущения (например, может влиять на ключи кэша со стороны провайдера). API VEGA также передаст некоторые специфичные для провайдера параметры, такие как `safe_prompt` для Mistral или `raw_mode` для Hyperbolic напрямую соответствующим провайдерам, если они указаны.

Пожалуйста, обратитесь к разделу провайдера модели, чтобы подтвердить, какие параметры поддерживаются. Для подробных рекомендаций см. [управление параметрами, специфичными для провайдера](/docs/guides/routing/provider-selection#requiring-providers-to-support-all-parameters).

## Температура

* Ключ: `temperature`  
* Опционально, **float**, от 0.0 до 2.0  
* По умолчанию: 1.0  
* Видео‑объяснение: [Смотреть](https://youtu.be/ezgqHnWvua8)

Эта настройка влияет на разнообразие ответов модели. Низкие значения приводят к более предсказуемым и типичным ответам, в то время как более высокие значения способствуют более разнообразным и редким ответам. При значении 0 модель всегда выдаёт один и тот же ответ на данный ввод.

## Top P

* Ключ: `top_p`  
* Опционально, **float**, от 0.0 до 1.0  
* По умолчанию: 1.0  
* Видео‑объяснение: [Смотреть](https://youtu.be/wQP-im_HInk)

Эта настройка ограничивает выбор модели процентом вероятных токенов: только топ‑токены, чьи вероятности в сумме дают P. Более низкое значение делает ответы модели более предсказуемыми, тогда как значение по умолчанию позволяет использовать весь диапазон токенов. Можно сравнить с динамическим Top‑K.

## Top K

* Ключ: `top_k`  
* Опционально, **integer**, 0 или выше  
* По умолчанию: 0  
* Видео‑объяснение: [Смотреть](https://youtu.be/EbZv6-N8Xlk)

Ограничивает выбор токенов моделью на каждом шаге, заставляя её выбирать из меньшего набора. Значение 1 означает, что модель всегда выбирает наиболее вероятный следующий токен, что приводит к предсказуемым результатам. По умолчанию эта настройка отключена, и модель рассматривает все варианты.

## Штраф за частоту (Frequency Penalty)

* Ключ: `frequency_penalty`  
* Опционально, **float**, от -2.0 до 2.0  
* По умолчанию: 0.0  
* Видео‑объяснение: [Смотреть](https://youtu.be/p4gl6fqI0_w)

Эта настройка направлена на контроль повторения токенов в зависимости от того, как часто они встречаются во входных данных. Она пытается использовать реже те токены, которые чаще встречаются во вводе, пропорционально их частоте. Штраф масштабируется с количеством появлений. Отрицательные значения будут поощрять повторное использование токенов.

## Штраф за присутствие (Presence Penalty)

* Ключ: `presence_penalty`  
* Опционально, **float**, от -2.0 до 2.0  
* По умолчанию: 0.0  
* Видео‑объяснение: [Смотреть](https://youtu.be/MwHG5HL-P74)

Регулирует, как часто модель повторяет конкретные токены, уже использованные во входных данных. Более высокие значения делают такое повторение менее вероятным, а отрицательные — более вероятным. Штраф за присутствие не масштабируется с количеством появлений. Отрицательные значения будут поощрять повторное использование токенов.

## Штраф за повторение (Repetition Penalty)

* Ключ: `repetition_penalty`  
* Опционально, **float**, от 0.0 до 2.0  
* По умолчанию: 1.0  
* Видео‑объяснение: [Смотреть](https://youtu.be/LHjGAnLm3DM)

Помогает уменьшить повторение токенов из входных данных. Более высокое значение делает модель менее склонной к повторениям, но слишком высокое значение может ухудшить связность вывода (часто появляются «бегущие» предложения без небольших слов). Штраф масштабируется в зависимости от исходной вероятности токена.

## Min P

* Ключ: `min_p`  
* Опционально, **float**, от 0.0 до 1.0  
* По умолчанию: 0.0  

Определяет минимальную вероятность токена для его учёта, относительно вероятности самого вероятного токена. (Значение меняется в зависимости от уверенности в наиболее вероятном токене.) Если ваш Min‑P установлен в 0.1, это значит, что будут учитываться только токены, вероятность которых как минимум в 10 раз ниже лучшего варианта.

## Top A

* Ключ: `top_a`  
* Опционально, **float**, от 0.0 до 1.0  
* По умолчанию: 0.0  

Учитывает только топ‑токены с «достаточно высокой» вероятностью относительно вероятности самого вероятного токена. Можно сравнить с динамическим Top‑P. Низкое значение Top‑A фокусирует выбор на токене с наивысшей вероятностью, но в более узком диапазоне. Высокое значение Top‑A не обязательно влияет на креативность вывода, а скорее уточняет процесс фильтрации на основе максимальной вероятности.

## Seed

* Ключ: `seed`  
* Опционально, **integer**  

Если указано, инференс будет детерминированным, так что повторные запросы с тем же seed и теми же параметрами должны возвращать одинаковый результат. Детерминизм не гарантируется для некоторых моделей.

## Max Tokens

* Ключ: `max_tokens`  
* Опционально, **integer**, от 1 и выше  

Устанавливает верхний предел количества токенов, которые модель может сгенерировать в ответе. Она не превысит этот лимит. Максимальное значение равно длине контекста минус длина подсказки.

## Max Completion Tokens

* Ключ: `max_completion_tokens`  
* Опционально, **integer**, от 1 и выше  

Устанавливает верхний предел количества токенов, которые модель может сгенерировать в ответе. Она не превысит этот лимит. Максимальное значение равно длине контекста минус длина подсказки.

## Logit Bias

* Ключ: `logit_bias`  
* Опционально, **map**  

Принимает JSON‑объект, сопоставляющий токены (указанные их ID в токенизаторе) с соответствующим значением смещения от -100 до 100. Математически смещение добавляется к логитам, генерируемым моделью перед сэмплированием. Точный эффект будет различаться в зависимости от модели, но значения от -1 до 1 должны уменьшать или увеличивать вероятность выбора; значения вроде -100 или 100 должны приводить к запрету или эксклюзивному выбору соответствующего токена.

## Logprobs

* Ключ: `logprobs`  
* Опционально, **boolean**  

Определяет, возвращать ли лог‑вероятности токенов вывода. Если `true`, возвращаются лог‑вероятности каждого выданного токена.

## Top Logprobs

* Ключ: `top_logprobs`  
* Опционально, **integer**  

Целое число от 0 до 20, указывающее количество наиболее вероятных токенов, которые следует вернуть для каждой позиции токена, каждый с соответствующей лог‑вероятностью. Параметр `logprobs` должен быть установлен в `true`, если используется этот параметр.

## Формат ответа (Response Format)

* Ключ: `response_format`  
* Опционально, **map**  

Принуждает модель выдавать вывод в определённом формате. Установка `{ "type": "json_object" }` включает режим JSON, который гарантирует, что сообщение модели будет корректным JSON.

**Примечание**: при использовании режима JSON также следует явно попросить модель генерировать JSON через системное или пользовательское сообщение.

## Структурированные выводы (Structured Outputs)

* Ключ: `structured_outputs`  
* Опционально, **boolean**  

Если модель поддерживает структурированные выводы с помощью `response_format` и `json_schema`.

## Stop

* Ключ: `stop`  
* Опционально, **array**  

Немедленно прекращает генерацию, если модель встречает любой токен, указанный в массиве `stop`.

## Tools

* Ключ: `tools`  
* Опционально, **array**  

Параметр вызова инструмента, соответствующий форме запроса OpenAI. Для провайдеров, не являющихся OpenAI, будет преобразован соответствующим образом. Подробнее в [руководстве по вызову инструментов](/docs/guides/features/tool-calling).

## Tool Choice

* Ключ: `tool_choice`  
* Опционально, **string or object**  

Определяет, какой (если какой‑то) инструмент будет вызван моделью. `none` означает, что модель не будет вызывать инструмент и вместо этого сгенерирует сообщение. `auto` позволяет модели выбирать между генерацией сообщения и вызовом одного или нескольких инструментов. `required` заставляет модель вызвать один или несколько инструментов. Указание конкретного инструмента через `{"type": "function", "function": {"name": "my_function"}}` принуждает модель вызвать именно этот инструмент.

## Parallel Tool Calls

* Ключ: `parallel_tool_calls`  
* Опционально, **boolean**  
* По умолчанию: **true**  

Определяет, включать ли параллельный вызов функций при использовании инструментов. Если `true`, модель может вызывать несколько функций одновременно. Если `false`, функции будут вызываться последовательно. Применяется только при наличии предоставленных инструментов.

## Include Reasoning

* Ключ: `include_reasoning`  
* Опционально, **boolean**  

Устаревший синоним для `reasoning.exclude`. При `true` токены рассуждения возвращаются в ответе, если модель их поддерживает.

## Reasoning

* Ключ: `reasoning`  
* Опционально, **map**  

Контролирует поведение рассуждений для моделей, поддерживающих токены мышления, включая включение рассуждений, их усилие, максимальное количество токенов рассуждения и исключение рассуждений из ответа.

## Reasoning Effort

* Ключ: `reasoning_effort`  
* Опционально, **enum** (xhigh, high, medium, low, minimal, none)  

Настройка усилия рассуждения в стиле OpenAI. Более высокие значения позволяют модели тратить больше токенов на внутренние рассуждения, если они поддерживаются.

## Web Search Options

* Ключ: `web_search_options`  
* Опционально, **map**  

Настраивает нативные параметры веб‑поиска для моделей и провайдеров, поддерживающих ответы, связанные с веб‑поиском.

## Verbosity

* Ключ: `verbosity`  
* Опционально, **enum** (low, medium, high, xhigh, max)  
* По умолчанию: **medium**  

Ограничивает многословность ответа модели. Низкие значения дают более лаконичные ответы, а высокие — более детальные и всесторонние. Введено OpenAI для Responses API.

Для моделей Anthropic этот параметр сопоставляется с `output_config.effort`. Уровень `xhigh` поддерживается Anthropic Claude 4.7 Opus и более новыми моделями. Уровень `max` поддерживается Anthropic Claude 4.6 Opus и более новыми моделями.