Максим Зотеев
Яндекс Путешествия
Собрать AI-агента сейчас может почти любой разработчик, а вот понять, хорошо ли он работает, гораздо сложнее. Чаще всего качество оценивают на глаз, по принципу «мне кажется, стало лучше».
На воркшопе научимся заменять это ощущение воспроизводимым числом. Сначала пройдем по лестнице метрик: от дешевых точных проверок кодом до LLM-as-a-judge, когда вторая модель оценивает ответ агента по смыслу. Разберем конкретный случай: почему судье лучше поручить сопоставление ответа с эталоном, а не выставление баллов, и как по его разметке обычным кодом посчитать precision, recall и F1. Покажу, почему одна цифра F1 может скрывать противоположные проблемы и как собрать golden set, который не превратится в подгонку под пару примеров.
В практической части вживую улучшим настоящего агента на Claude, который превращает тикет в чек-лист тестирования, а судьей будет GPT. Снимем baseline, по метрикам найдем, что именно сломано, поправим промпт и поднимем качество. Затем проверим прирост на отложенной задаче, которую промпт не видел, чтобы убедиться, что это не подгонка.
В итоге у вас будет понятный план, с чего начать оценку своего агента уже завтра, и открытый проект на GitHub, который можно взять за основу.
Яндекс Путешествия