qwen
Qwen

Qwen: Qwen3 VL 235B A22B Instruct

qwen/qwen3-vl-235b-a22b-instruct
Контекст
262 144
Вход токены
24,61 ₽/M
Выход токены
108,29 ₽/M
Кэш чтение
13,54 ₽/M
описание

Qwen3-VL-235B-A22B Instruct — это открытая многомодальная модель, объединяющая мощную генерацию текста с визуальным пониманием изображений и видео. Инструкторная модель ориентирована на общее использование в области зрительно-языковых задач (VQA, разбор документов, извлечение данных из диаграмм/таблиц, многоязычный OCR). Серия делает акцент на надёжное восприятие (распознавание разнообразных реальных и синтетических категорий), пространственное понимание (2D/3D привязка) и длительное визуальное восприятие, демонстрируя конкурентные результаты на публичных многомодальных бенчмарках как в восприятии, так и в рассуждениях.

Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: она может следовать сложным инструкциям в диалогах с несколькими изображениями и множеством ходов; выравнивать текст с видеотаймлайнами для точных временных запросов; а также управлять элементами графического интерфейса для задач автоматизации. Модели также позволяют реализовать визуальные кодирующие рабочие процессы — превращать эскизы или макеты в код и помогать в отладке пользовательского интерфейса — при этом сохраняют сильные результаты в режиме только текста, сравнимые с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL подходящим для производственных сценариев, охватывающих документный ИИ, многоязычный OCR, помощь в программном обеспечении/интерфейсе, пространственные/воплощённые задачи и исследования зрительно-языковых агентов.

модальности
+
интеграция

Как использовать через API

bash
# Запрос к API VEGA через qwen/qwen3-vl-235b-a22b-instruct
curl https://api.vega.chat/api/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $VEGA_API_KEY" \
  -d '{
    "model": "qwen/qwen3-vl-235b-a22b-instruct",
    "messages": [
      {  "role": "user", "content": "Hello!"  }
    ]
  }'