qwen
Qwen

Qwen: Qwen3 VL 235B A22B Thinking

qwen/qwen3-vl-235b-a22b-thinking
Контекст
131 072
Вход токены
31,99 ₽/M
Выход токены
319,94 ₽/M
описание

Qwen3-VL-235B-A22B Thinking — это мультимодальная модель, объединяющая мощную генерацию текста с визуальным пониманием изображений и видео. Модель Thinking оптимизирована для мультимодального рассуждения в областях STEM и математики. Серия делает акцент на надёжном восприятии (распознавание разнообразных реальных и синтетических категорий), пространственном понимании (2D/3D привязка) и длительном визуальном восприятии, демонстрируя конкурентные результаты на публичных мультимодальных бенчмарках как в восприятии, так и в рассуждениях.

Помимо анализа, Qwen3-VL поддерживает агентное взаимодействие и использование инструментов: она может следовать сложным инструкциям в диалогах с несколькими изображениями и множеством ходов; выравнивать текст с видеотаймлайнами для точных временных запросов; а также управлять элементами графического интерфейса для задач автоматизации. Модели также позволяют реализовывать визуальные кодирующие рабочие процессы, превращая эскизы или макеты в код и помогая в отладке пользовательского интерфейса, при этом сохраняя сильные результаты в режиме только текста, сравнимые с флагманскими языковыми моделями Qwen3. Это делает Qwen3-VL подходящей для производственных сценариев, охватывающих документный ИИ, многоязычное OCR, помощь в программном обеспечении/интерфейсе, пространственные/воплощённые задачи и исследования агентов визуально‑языкового типа.

модальности
+
интеграция

Как использовать через API

bash
# Запрос к API VEGA через qwen/qwen3-vl-235b-a22b-thinking
curl https://api.vega.chat/api/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $VEGA_API_KEY" \
  -d '{
    "model": "qwen/qwen3-vl-235b-a22b-thinking",
    "messages": [
      {  "role": "user", "content": "Hello!"  }
    ]
  }'