EvalCore
Это open-source CLI инструмент, который записывает ответы AI моделей и проигрывает их в CI. Отличное решение, чтобы вовремя ловить регрессии.
| Что это | Это open-source CLI инструмент, который записывает ответы AI моделей и проигрывает их в CI. Отличное решение, чтобы вовремя ловить регрессии. |
|---|---|
| Цены | Free |
| Бесплатный тариф | Да |
| Платформа | Web Application |
| Хорошо подходит для | Catching regressions when changing prompts, models, or dependencies, Running deterministic, offline eval suites in CI pipelines |
| Домен зарегистрирован | 2026 |
Данные обновлены 24 июля 2026 г.
Что делает EvalCore?
EvalCore — это легкий CLI-инструмент, который помогает вовремя заметить, что ваше AI-приложение начало работать хуже, еще до того, как на это пожалуются пользователи.
Принцип работы простой: вы описываете тестовые кейсы в YAML-файле и подгружаете датасет в JSONL. Сначала запускаете инструмент один раз на реальной модели, чтобы EvalCore записал все запросы и ответы в локальный SQLite-кеш. После этого любой новый запуск при изменении кода или промпта превращается в «воспроизведение» этой записи. Такой подход делает тесты в CI офлайн-процессом: они работают детерминировано, мгновенно и абсолютно бесплатно, избавляя команду от нестабильных тестов и лишних счетов за API.
Главная фишка EvalCore — в его минимализме. Вам не нужно интегрировать SDK или изучать очередной тестовый фреймворк. Это один бинарный файл, который общается с вашим приложением через HTTP или shell, независимо от того, на каком языке оно написано. Инструмент совместим с OpenAI, vLLM, Ollama, любыми OpenAI-совместимыми шлюзами или вашими собственными REST API. Чтобы определить, что именно считать «хорошим» результатом, можно комбинировать разные скореры — например, проверять наличие ключевого слова или использовать рубрикатор-судью.
EvalCore создан для разработчиков, которые активно внедряют AI-фичи: от соло-разработчиков, дорабатывающих промпты, до больших команд с множеством версий моделей. Он незаменим, когда вы меняете модель, правите инструкции или обновляете зависимости и хотите сразу понять, не сломалось ли что-то важное. Поскольку в CI всё работает офлайн и без API-ключей, инструмент легко вписывается в привычный workflow с PR и проверкой exit-кодов.
Если вы хоть раз выкатывали правку в промпте, которая незаметно сделала вашего чат-бота глупее, EvalCore станет той самой страховочной сеткой, которой вам не хватало.
Ключевые возможности
Что выделяет инструментДля кого EvalCore?
Кому подходит этот инструментДоверие и присутствие
Альтернативы в категории Тестирование
Автоматизированное тестирование API для проверки ответов, сгенерированных ИИ. Проверяйте точность, полноту и корректность ответов, сравнивая их с достоверным источником истины.
Этот инструмент сам докручивает промпты и подбирает подходящие AI-модели для вашего приложения. В итоге приложение работает быстрее, а расходы на API становятся заметно ниже.
Это платформа для автоматизации тестирования на базе AI, где вообще не нужно писать код. Подходит для всего: от веб-сайтов и мобильных приложений до API и сложных корпоративных систем.
AI-агент для тестирования, который сам «ходит» по вашему приложению, находит баги и передает их кодинг-агенту для автоматического исправления.
Разбирайтесь с ошибками AI-агентов без лишней головной боли: просто создайте форк того самого шага, на котором всё сломалось, отладьте его и убедитесь, что фикс работает, прежде чем выкатывать обновление в продакшн.
Платформа для AI observability: отслеживайте работу моделей в продакшене, оценивайте их качество и доводите до идеала.
Open-source платформа для тестирования AI-агентов. Запускайте симуляции, ловите регрессии и выпускайте автономных агентов с полной уверенностью в результате. Инструмент создан для разработчиков, которые относятся к AI как к полноценному софту. Симуляции агентов — это новые unit-тесты.
Платформа для оценки и оптимизации RAG-конвейеров и генеративных AI-приложений с помощью автоматизированного и гибридного (human-in-the-loop) тестирования.