qwen
Qwen

Qwen: Qwen3 VL 8B Instruct

qwen/qwen3-vl-8b-instruct
Контекст
256 000
Вход токены
9,84 ₽/M
Выход токены
61,53 ₽/M
описание

Qwen3-VL-8B-Instruct — это мультимодальная модель «зрение‑язык» из серии Qwen3-VL, разработанная для высокоточной интерпретации и рассуждения над текстом, изображениями и видео. Она обладает улучшенным мультимодальным слиянием с помощью Interleaved-MRoPE для длительного временного рассуждения, DeepStack для детального согласования визуального и текстового контента, а также выравниванием текста и временных меток для точного локализования событий.

Модель поддерживает нативное контекстное окно в 256 K токенов, расширяемое до 1 M токенов, и обрабатывает как статические, так и динамические медиа‑вводы для задач, таких как разбор документов, визуальное вопрос‑ответ, пространственное рассуждение и управление графическим интерфейсом. Она достигает уровня понимания текста, сопоставимого с ведущими LLM, одновременно расширяя охват OCR до 32 языков и повышая устойчивость при разнообразных визуальных условиях.

модальности
+
интеграция

Как использовать через API

bash
# Запрос к API VEGA через qwen/qwen3-vl-8b-instruct
curl https://api.vega.chat/api/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $VEGA_API_KEY" \
  -d '{
    "model": "qwen/qwen3-vl-8b-instruct",
    "messages": [
      {  "role": "user", "content": "Hello!"  }
    ]
  }'