GLM-5.3-Prime — это высокоскоростной вариант GLM-5.3 от Z.ai, унаследовавший все его возможности и обеспечивающий в 1,5–2 раза более высокую пропускную способность вывода благодаря ускорению инференса. Модель поддерживает ввод и вывод текста, контекстное окно на 1M токенов и до 128K выходных токенов, а также предназначена для задач программирования и агентных нагрузок, включая долгосрочную оркестрацию многошаговых взаимодействий агентов, общение в реальном времени и потоковую генерацию кода.
Режим рассуждений всегда включён и не может быть отключён. Поддерживаются уровни интенсивности рассуждений low, high и max; по умолчанию используется max.
# Запрос к API VEGA через z-ai/glm-5.3-prime
curl https://api.vega.chat/api/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $VEGA_API_KEY" \
-d '{
"model": "z-ai/glm-5.3-prime",
"messages": [
{ "role": "user", "content": "Hello!" }
]
}'