◆ GLM-5.3-FlashX — это высокоскоростной вариант модели ◆ GLM-5.3-Flash от Z.ai, нативной мультимодальной модели, обеспечивающей скорость инференса до 200 токенов/с. Построенная на той же гибридной архитектуре с разреженным и линейным вниманием (320B всего параметров, 18B активных), она подходит для эффективного программирования, понимания визуальной информации и долгосрочных агентных задач с контекстным окном в 1M токенов.
# Запрос к API VEGA через z-ai/glm-5.3-flashx
curl https://api.vega.chat/api/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $VEGA_API_KEY" \
-d '{
"model": "z-ai/glm-5.3-flashx",
"messages": [
{ "role": "user", "content": "Hello!" }
]
}'