Индекс документации

Получите полный индекс документации по адресу: https://api.vega.chat/docs/llms.txt
Используйте этот файл, чтобы узнать о всех доступных страницах перед дальнейшим изучением.

Параметры

MD версия

Параметры сэмплинга формируют процесс генерации токенов моделью. Вы можете отправлять любые параметры из следующего списка, а также другие, в API VEGA.

Когда параметр сэмплинга отсутствует в вашем запросе, API VEGA опускает его upstream, а не заменяет жёстко заданным значением, поэтому провайдер применяет своё собственное значение по умолчанию. «По умолчанию», указанное для каждого параметра ниже, — это обычное значение, а не то, которое внедряет API VEGA. Явная передача его (например, temperature: 1.0) всё равно будет переслана и может отличаться от его опущения (например, может влиять на ключи кэша со стороны провайдера). API VEGA также передаст некоторые специфичные для провайдера параметры, такие как safe_prompt для Mistral или raw_mode для Hyperbolic напрямую соответствующим провайдерам, если они указаны.

Пожалуйста, обратитесь к разделу провайдера модели, чтобы подтвердить, какие параметры поддерживаются. Для подробных рекомендаций см. управление параметрами, специфичными для провайдера.

Температура

  • Ключ: temperature
  • Опционально, float, от 0.0 до 2.0
  • По умолчанию: 1.0
  • Видео‑объяснение: Смотреть

Эта настройка влияет на разнообразие ответов модели. Низкие значения приводят к более предсказуемым и типичным ответам, в то время как более высокие значения способствуют более разнообразным и редким ответам. При значении 0 модель всегда выдаёт один и тот же ответ на данный ввод.

Top P

  • Ключ: top_p
  • Опционально, float, от 0.0 до 1.0
  • По умолчанию: 1.0
  • Видео‑объяснение: Смотреть

Эта настройка ограничивает выбор модели процентом вероятных токенов: только топ‑токены, чьи вероятности в сумме дают P. Более низкое значение делает ответы модели более предсказуемыми, тогда как значение по умолчанию позволяет использовать весь диапазон токенов. Можно сравнить с динамическим Top‑K.

Top K

  • Ключ: top_k
  • Опционально, integer, 0 или выше
  • По умолчанию: 0
  • Видео‑объяснение: Смотреть

Ограничивает выбор токенов моделью на каждом шаге, заставляя её выбирать из меньшего набора. Значение 1 означает, что модель всегда выбирает наиболее вероятный следующий токен, что приводит к предсказуемым результатам. По умолчанию эта настройка отключена, и модель рассматривает все варианты.

Штраф за частоту (Frequency Penalty)

  • Ключ: frequency_penalty
  • Опционально, float, от -2.0 до 2.0
  • По умолчанию: 0.0
  • Видео‑объяснение: Смотреть

Эта настройка направлена на контроль повторения токенов в зависимости от того, как часто они встречаются во входных данных. Она пытается использовать реже те токены, которые чаще встречаются во вводе, пропорционально их частоте. Штраф масштабируется с количеством появлений. Отрицательные значения будут поощрять повторное использование токенов.

Штраф за присутствие (Presence Penalty)

  • Ключ: presence_penalty
  • Опционально, float, от -2.0 до 2.0
  • По умолчанию: 0.0
  • Видео‑объяснение: Смотреть

Регулирует, как часто модель повторяет конкретные токены, уже использованные во входных данных. Более высокие значения делают такое повторение менее вероятным, а отрицательные — более вероятным. Штраф за присутствие не масштабируется с количеством появлений. Отрицательные значения будут поощрять повторное использование токенов.

Штраф за повторение (Repetition Penalty)

  • Ключ: repetition_penalty
  • Опционально, float, от 0.0 до 2.0
  • По умолчанию: 1.0
  • Видео‑объяснение: Смотреть

Помогает уменьшить повторение токенов из входных данных. Более высокое значение делает модель менее склонной к повторениям, но слишком высокое значение может ухудшить связность вывода (часто появляются «бегущие» предложения без небольших слов). Штраф масштабируется в зависимости от исходной вероятности токена.

Min P

  • Ключ: min_p
  • Опционально, float, от 0.0 до 1.0
  • По умолчанию: 0.0

Определяет минимальную вероятность токена для его учёта, относительно вероятности самого вероятного токена. (Значение меняется в зависимости от уверенности в наиболее вероятном токене.) Если ваш Min‑P установлен в 0.1, это значит, что будут учитываться только токены, вероятность которых как минимум в 10 раз ниже лучшего варианта.

Top A

  • Ключ: top_a
  • Опционально, float, от 0.0 до 1.0
  • По умолчанию: 0.0

Учитывает только топ‑токены с «достаточно высокой» вероятностью относительно вероятности самого вероятного токена. Можно сравнить с динамическим Top‑P. Низкое значение Top‑A фокусирует выбор на токене с наивысшей вероятностью, но в более узком диапазоне. Высокое значение Top‑A не обязательно влияет на креативность вывода, а скорее уточняет процесс фильтрации на основе максимальной вероятности.

Seed

  • Ключ: seed
  • Опционально, integer

Если указано, инференс будет детерминированным, так что повторные запросы с тем же seed и теми же параметрами должны возвращать одинаковый результат. Детерминизм не гарантируется для некоторых моделей.

Max Tokens

  • Ключ: max_tokens
  • Опционально, integer, от 1 и выше

Устанавливает верхний предел количества токенов, которые модель может сгенерировать в ответе. Она не превысит этот лимит. Максимальное значение равно длине контекста минус длина подсказки.

Max Completion Tokens

  • Ключ: max_completion_tokens
  • Опционально, integer, от 1 и выше

Устанавливает верхний предел количества токенов, которые модель может сгенерировать в ответе. Она не превысит этот лимит. Максимальное значение равно длине контекста минус длина подсказки.

Logit Bias

  • Ключ: logit_bias
  • Опционально, map

Принимает JSON‑объект, сопоставляющий токены (указанные их ID в токенизаторе) с соответствующим значением смещения от -100 до 100. Математически смещение добавляется к логитам, генерируемым моделью перед сэмплированием. Точный эффект будет различаться в зависимости от модели, но значения от -1 до 1 должны уменьшать или увеличивать вероятность выбора; значения вроде -100 или 100 должны приводить к запрету или эксклюзивному выбору соответствующего токена.

Logprobs

  • Ключ: logprobs
  • Опционально, boolean

Определяет, возвращать ли лог‑вероятности токенов вывода. Если true, возвращаются лог‑вероятности каждого выданного токена.

Top Logprobs

  • Ключ: top_logprobs
  • Опционально, integer

Целое число от 0 до 20, указывающее количество наиболее вероятных токенов, которые следует вернуть для каждой позиции токена, каждый с соответствующей лог‑вероятностью. Параметр logprobs должен быть установлен в true, если используется этот параметр.

Формат ответа (Response Format)

  • Ключ: response_format
  • Опционально, map

Принуждает модель выдавать вывод в определённом формате. Установка { "type": "json_object" } включает режим JSON, который гарантирует, что сообщение модели будет корректным JSON.

Примечание: при использовании режима JSON также следует явно попросить модель генерировать JSON через системное или пользовательское сообщение.

Структурированные выводы (Structured Outputs)

  • Ключ: structured_outputs
  • Опционально, boolean

Если модель поддерживает структурированные выводы с помощью response_format и json_schema.

Stop

  • Ключ: stop
  • Опционально, array

Немедленно прекращает генерацию, если модель встречает любой токен, указанный в массиве stop.

Tools

  • Ключ: tools
  • Опционально, array

Параметр вызова инструмента, соответствующий форме запроса OpenAI. Для провайдеров, не являющихся OpenAI, будет преобразован соответствующим образом. Подробнее в руководстве по вызову инструментов.

Tool Choice

  • Ключ: tool_choice
  • Опционально, string or object

Определяет, какой (если какой‑то) инструмент будет вызван моделью. none означает, что модель не будет вызывать инструмент и вместо этого сгенерирует сообщение. auto позволяет модели выбирать между генерацией сообщения и вызовом одного или нескольких инструментов. required заставляет модель вызвать один или несколько инструментов. Указание конкретного инструмента через {"type": "function", "function": {"name": "my_function"}} принуждает модель вызвать именно этот инструмент.

Parallel Tool Calls

  • Ключ: parallel_tool_calls
  • Опционально, boolean
  • По умолчанию: true

Определяет, включать ли параллельный вызов функций при использовании инструментов. Если true, модель может вызывать несколько функций одновременно. Если false, функции будут вызываться последовательно. Применяется только при наличии предоставленных инструментов.

Include Reasoning

  • Ключ: include_reasoning
  • Опционально, boolean

Устаревший синоним для reasoning.exclude. При true токены рассуждения возвращаются в ответе, если модель их поддерживает.

Reasoning

  • Ключ: reasoning
  • Опционально, map

Контролирует поведение рассуждений для моделей, поддерживающих токены мышления, включая включение рассуждений, их усилие, максимальное количество токенов рассуждения и исключение рассуждений из ответа.

Reasoning Effort

  • Ключ: reasoning_effort
  • Опционально, enum (xhigh, high, medium, low, minimal, none)

Настройка усилия рассуждения в стиле OpenAI. Более высокие значения позволяют модели тратить больше токенов на внутренние рассуждения, если они поддерживаются.

Web Search Options

  • Ключ: web_search_options
  • Опционально, map

Настраивает нативные параметры веб‑поиска для моделей и провайдеров, поддерживающих ответы, связанные с веб‑поиском.

Verbosity

  • Ключ: verbosity
  • Опционально, enum (low, medium, high, xhigh, max)
  • По умолчанию: medium

Ограничивает многословность ответа модели. Низкие значения дают более лаконичные ответы, а высокие — более детальные и всесторонние. Введено OpenAI для Responses API.

Для моделей Anthropic этот параметр сопоставляется с output_config.effort. Уровень xhigh поддерживается Anthropic Claude 4.7 Opus и более новыми моделями. Уровень max поддерживается Anthropic Claude 4.6 Opus и более новыми моделями.