← Все новости

Как мы строили eval и автоматизировали оптимизацию AI-агента для умного помощника

Привет! Меня зовут Алексей, я разработчик в Битрикс24. 

В первой части рассказывал про retrieval-часть нашего RAG для AI-помощника Марты: как мы перестраивали поиск по базе знаний, подбирали retrieval pipeline под продуктовую документацию и постепенно улучшали качество поиска через серию небольших экспериментов. Ещё разобрал, почему production RAG — это постоянная работа с retrieval, шумом и latency.

Сегодня  — как мы измеряли качество всей RAG-системы целиком. Расскажу про экспертный и синтетический датасеты, почему retrieval-метрики могут расходиться с реальным качеством ответов и как мы замкнули агентную петлю.

В конце покажу финальную картину метрик с замечаниями и поделюсь, какие полезные мысли появились во время работы.

Читать далее
Читать оригинал на Хабр — Искусственный интеллект →