EvalCore

Это open-source CLI инструмент, который записывает ответы AI моделей и проигрывает их в CI. Отличное решение, чтобы вовремя ловить регрессии.

Проверено Бесплатный тариф
Кратко о главном
Что это Это open-source CLI инструмент, который записывает ответы AI моделей и проигрывает их в CI. Отличное решение, чтобы вовремя ловить регрессии.
Цены Free
Бесплатный тариф Да
Платформа Web Application
Хорошо подходит для Catching regressions when changing prompts, models, or dependencies, Running deterministic, offline eval suites in CI pipelines
Домен зарегистрирован 2026

Данные обновлены 24 июля 2026 г.

Что делает EvalCore?

EvalCore — это легкий CLI-инструмент, который помогает вовремя заметить, что ваше AI-приложение начало работать хуже, еще до того, как на это пожалуются пользователи.

Принцип работы простой: вы описываете тестовые кейсы в YAML-файле и подгружаете датасет в JSONL. Сначала запускаете инструмент один раз на реальной модели, чтобы EvalCore записал все запросы и ответы в локальный SQLite-кеш. После этого любой новый запуск при изменении кода или промпта превращается в «воспроизведение» этой записи. Такой подход делает тесты в CI офлайн-процессом: они работают детерминировано, мгновенно и абсолютно бесплатно, избавляя команду от нестабильных тестов и лишних счетов за API.

Главная фишка EvalCore — в его минимализме. Вам не нужно интегрировать SDK или изучать очередной тестовый фреймворк. Это один бинарный файл, который общается с вашим приложением через HTTP или shell, независимо от того, на каком языке оно написано. Инструмент совместим с OpenAI, vLLM, Ollama, любыми OpenAI-совместимыми шлюзами или вашими собственными REST API. Чтобы определить, что именно считать «хорошим» результатом, можно комбинировать разные скореры — например, проверять наличие ключевого слова или использовать рубрикатор-судью.

EvalCore создан для разработчиков, которые активно внедряют AI-фичи: от соло-разработчиков, дорабатывающих промпты, до больших команд с множеством версий моделей. Он незаменим, когда вы меняете модель, правите инструкции или обновляете зависимости и хотите сразу понять, не сломалось ли что-то важное. Поскольку в CI всё работает офлайн и без API-ключей, инструмент легко вписывается в привычный workflow с PR и проверкой exit-кодов.

Если вы хоть раз выкатывали правку в промпте, которая незаметно сделала вашего чат-бота глупее, EvalCore станет той самой страховочной сеткой, которой вам не хватало.

#agent evaluation#ai behavior testing#ai testing#apache-2.0#baseline testing#ci for ai#cost-free ci#deterministic testing#eval runner#llm evals#llm regression testing#model comparison#no-server#no signup#no telemetry#offline replay#openai compatible#openinference traces#open source#opentelemetry traces#prompt regression testing#record replay#rest targets#shell targets#single-binary#snapshot testing#sqlite cassette#trial runs#yaml configuration

Ключевые возможности

Что выделяет инструмент
01
Записывайте ответы моделей один раз, а затем воспроизводите их в CI абсолютно детерминировано — без лишних запросов в сеть и без необходимости возиться с ключами.
02
Просто опишите все evals в одном YAML-файле: датасеты, цели и скореры. Никаких SDK не потребуется.
03
Работает с любым языком или стеком — главное, чтобы он поддерживал HTTP или shell-команды.
04
Инструмент «всеяден»: он поддерживает модели, совместимые с OpenAI, vLLM и Ollama. Также на борту есть работа с REST API, shell-командами и OTel-трейсами.
05
CI replay полностью бесплатен, работает офлайн и выдает абсолютно идентичные результаты байт в байт.

Для кого EvalCore?

Кому подходит этот инструмент
Catching regressions when changing prompts, models, or dependencies
Running deterministic, offline eval suites in CI pipelines
Comparing model outputs across versions or configurations

Доверие и присутствие

Домен Домен зарегистрирован в 2026

Альтернативы в категории Тестирование

EvalMy.AI Проверено Тестирование

Автоматизированное тестирование API для проверки ответов, сгенерированных ИИ. Проверяйте точность, полноту и корректность ответов, сравнивая их с достоверным источником истины.

LLMTest Проверено Тестирование

Этот инструмент сам докручивает промпты и подбирает подходящие AI-модели для вашего приложения. В итоге приложение работает быстрее, а расходы на API становятся заметно ниже.

ACCELQ Проверено Тестирование

Это платформа для автоматизации тестирования на базе AI, где вообще не нужно писать код. Подходит для всего: от веб-сайтов и мобильных приложений до API и сложных корпоративных систем.

TestSprite Проверено Тестирование

AI-агент для тестирования, который сам «ходит» по вашему приложению, находит баги и передает их кодинг-агенту для автоматического исправления.

Retrace Проверено Тестирование

Разбирайтесь с ошибками AI-агентов без лишней головной боли: просто создайте форк того самого шага, на котором всё сломалось, отладьте его и убедитесь, что фикс работает, прежде чем выкатывать обновление в продакшн.

Braintrust Проверено Тестирование

Платформа для AI observability: отслеживайте работу моделей в продакшене, оценивайте их качество и доводите до идеала.

LangWatch Проверено Тестирование

Open-source платформа для тестирования AI-агентов. Запускайте симуляции, ловите регрессии и выпускайте автономных агентов с полной уверенностью в результате. Инструмент создан для разработчиков, которые относятся к AI как к полноценному софту. Симуляции агентов — это новые unit-тесты.

n8n
EvalsOne Проверено Тестирование

Платформа для оценки и оптимизации RAG-конвейеров и генеративных AI-приложений с помощью автоматизированного и гибридного (human-in-the-loop) тестирования.

Поделиться X LinkedIn Telegram
EvalCore Перейти