EvalCore

Herramienta de CLI de código abierto que graba respuestas de modelos de IA y las reproduce en CI para detectar regresiones

Verificada Plan gratuito
Datos rápidos
Qué es Herramienta de CLI de código abierto que graba respuestas de modelos de IA y las reproduce en CI para detectar regresiones
Precios Free
Plan gratuito
Plataforma Web Application
Ideal para Catching regressions when changing prompts, models, or dependencies, Running deterministic, offline eval suites in CI pipelines
Dominio registrado 2026

Datos actualizados 24 de julio de 2026

¿Qué hace EvalCore?

EvalCore es una herramienta de CLI ligera que te ayuda a detectar cuándo tu aplicación de IA empieza a comportarse peor, antes de que tus usuarios lo noten. Defines los casos de evaluación en un archivo YAML sencillo más un conjunto de datos JSONL, lo ejecutas una vez contra tu modelo real para grabar cada solicitud y respuesta en un caché local de SQLite y luego reproduces esa grabación en cada cambio futuro de código o de prompt. La reproducción es offline, determinista y no cuesta nada en CI, por lo que tu equipo obtiene un feedback rápido y fiable sin pruebas inestables ni facturas de API.

Lo que hace que EvalCore destaque es lo minimalista que es. No hay ningún SDK que integrar ni ningún marco de pruebas que aprender; solo un binario único que se comunica mediante HTTP o shell con tu aplicación, independientemente del lenguaje en el que esté escrita. Funciona con OpenAI, vLLM, Ollama, cualquier gateway compatible con OpenAI o tus propias API REST. Puedes apilar evaluadores (como buscar una palabra clave o usar una rúbrica de juez) para definir qué significa "bueno" para cada caso. El modelo de grabar/reproducir significa que la primera ejecución en vivo captura el coste y la latencia, y cada ejecución posterior en CI es instantánea y gratuita.

Esta herramienta está creada para desarrolladores que lanzan funciones de IA, ya seas un desarrollador solitario iterando prompts o un equipo que gestiona múltiples versiones de modelos. Es especialmente útil cuando cambias de modelos, ajustas prompts o actualizas dependencias y quieres saber inmediatamente si algo se rompió. Debido a que se ejecuta totalmente offline en CI sin claves de API, encaja naturalmente en los flujos de trabajo de PR existentes y se basa en códigos de salida. Si alguna vez has lanzado un cambio de prompt que, silenciosamente, hizo que tu chatbot fuera más tonto, EvalCore es la red de seguridad que no sabías que necesitabas.

#agent evaluation#ai behavior testing#ai testing#apache-2.0#baseline testing#ci for ai#cost-free ci#deterministic testing#eval runner#llm evals#llm regression testing#model comparison#no-server#no signup#no telemetry#offline replay#openai compatible#openinference traces#open source#opentelemetry traces#prompt regression testing#record replay#rest targets#shell targets#single-binary#snapshot testing#sqlite cassette#trial runs#yaml configuration

Características principales

Qué la hace destacar
01
Graba las respuestas de tus modelos una sola vez y repítelas de forma determinista en tu CI, sin depender de la red ni de gestionar keys.
02
Configura tus evals en un solo archivo YAML con datasets, targets y scorers. Así de simple, sin necesidad de instalar ningún SDK.
03
Funciona con cualquier lenguaje o stack, siempre que soporte HTTP o comandos de shell.
04
Es compatible con modelos de OpenAI, vLLM y Ollama. Además, puedes integrarlo mediante REST APIs, ejecutar comandos de shell y hacer seguimiento de todo con OTel traces.
05
CI replay es gratis y funciona offline, asegurando resultados idénticos bit a bit.

¿Para quién es EvalCore?

Quién saca más provecho de esta herramienta
Catching regressions when changing prompts, models, or dependencies
Running deterministic, offline eval suites in CI pipelines
Comparing model outputs across versions or configurations

Confianza y presencia

Dominio Dominio registrado en 2026

Alternativas en Pruebas

EvalMy.AI Verificada Pruebas

API de pruebas automatizadas para respuestas generadas por IA: verifica la precisión, completitud y corrección frente a una fuente de verdad.

LLMTest Verificada Pruebas

Optimiza automáticamente los prompts y los modelos de IA en tu app para mejorar el rendimiento y reducir costes.

ACCELQ Verificada Pruebas

Plataforma de automatización de pruebas sin código basada en IA para aplicaciones web, móviles, API y empresariales.

TestSprite Verificada Pruebas

Agente de pruebas de IA que explora tu aplicación en vivo, encuentra errores y permite que tu agente de programación los corrija automáticamente

Retrace Verificada Pruebas

Reproduce y depura fallos de agentes de IA bifurcando el paso exacto que falló y comprobando la solución antes del despliegue

Braintrust Verificada Pruebas

Plataforma de observabilidad de IA: rastrea, evalúa y mejora modelos de IA en producción

LangWatch Verificada Pruebas

Plataforma de pruebas de código abierto para agentes de IA. Ejecuta simulaciones, detecta regresiones y lanza agentes autónomos con confianza. Creada para desarrolladores que tratan la IA como software. Las simulaciones de agentes son los nuevos tests unitarios

n8n
EvalsOne Verificada Pruebas

Plataforma para evaluar y optimizar pipelines de RAG y aplicaciones de IA generativa con pruebas automatizadas y supervisión humana.

Compartir X LinkedIn Telegram
EvalCore Visitar