Как проверить, что ИИ-агент в IDE работает, если на одинаковые запросы LLM отвечает по-разному? Ответы модели недетерминированы, а интерфейс и бизнес-логика вполне детерминированы, и их нужно тестировать отдельно.
Мы делаем ИИ-агента, встраиваемого в JetBrains IDE. В статье расскажу, как мы выстроили UI-автоматизацию плагина так, чтобы тесты ловили регрессии в интерфейсе, бизнес-логике и при этом не «моргали» из-за нестабильности LLM.
Статья пригодится, если вы QA-инженер или разработчик и вам интересны:
Выстраивание UI-автоматизации на примере IDE-плагина
Тестирование приложений с ИИ-функциями
Разделение ответственности между детерминированной и недетерминированной частями системы