API VEGA

Оценивайте agent через agents-cli: запускайте проверки на датасете, измеряйте качество ответов и работы с инструментами, анализируйте провалы и сравнивайте результаты до и после изменений. Навык помогает настроить цикл улучшения для проектов на разных фреймворках.

Возможности

  • Подсказывает, как подготовить датасет EvaluationDataset для одиночных и многошаговых сценариев.
  • Помогает выбрать встроенные метрики: например, multi_turn_task_success, hallucination и safety.
  • Показывает, как настроить custom metrics: детерминированные проверки на Python или LLM-as-judge.
  • Описывает цикл запуска, анализа ошибок и повторной проверки; для сравнения результатов используется eval compare.
  • Разбирает причины низких оценок и связывает их с правками инструкций, tool descriptions и логики agent.

Когда использовать

  • Нужно запустить оценку agent или проверить изменения перед deploy.
  • Нужно составить датасет для eval или выбрать метрики.
  • Оценки упали, и нужно понять, что исправлять.
  • Нужно сравнить результаты до и после правок или настроить custom metric.

Установка

uv tool install google-agents-cli

Примеры

Запустить eval на стандартном датасете:

agents-cli eval run

Выбрать датасет, метрики и каталог результатов:

agents-cli eval run --dataset tests/eval/datasets/custom.json --metrics final_response_quality,safety --output ./out/

Сравнить результаты до и после изменений:

agents-cli eval compare baseline.json candidate.json