Оценивайте agent через agents-cli: запускайте проверки на датасете, измеряйте качество ответов и работы с инструментами, анализируйте провалы и сравнивайте результаты до и после изменений. Навык помогает настроить цикл улучшения для проектов на разных фреймворках.
Возможности
- Подсказывает, как подготовить датасет
EvaluationDatasetдля одиночных и многошаговых сценариев. - Помогает выбрать встроенные метрики: например,
multi_turn_task_success,hallucinationиsafety. - Показывает, как настроить custom metrics: детерминированные проверки на Python или LLM-as-judge.
- Описывает цикл запуска, анализа ошибок и повторной проверки; для сравнения результатов используется
eval compare. - Разбирает причины низких оценок и связывает их с правками инструкций, tool descriptions и логики agent.
Когда использовать
- Нужно запустить оценку agent или проверить изменения перед deploy.
- Нужно составить датасет для eval или выбрать метрики.
- Оценки упали, и нужно понять, что исправлять.
- Нужно сравнить результаты до и после правок или настроить custom metric.
Установка
uv tool install google-agents-cli
Примеры
Запустить eval на стандартном датасете:
agents-cli eval run
Выбрать датасет, метрики и каталог результатов:
agents-cli eval run --dataset tests/eval/datasets/custom.json --metrics final_response_quality,safety --output ./out/
Сравнить результаты до и после изменений:
agents-cli eval compare baseline.json candidate.json