PX-bench
Benchmark para agentes de programación que califica la experiencia de producto en 8 dimensiones como diseño, accesibilidad y resiliencia
| Qué es | Benchmark para agentes de programación que califica la experiencia de producto en 8 dimensiones como diseño, accesibilidad y resiliencia |
|---|---|
| Precios | Unknown |
| Plataforma | Web Application |
| Ideal para | evaluating coding agents' product experience quality, identifying regressions and quality gaps in agent outputs |
| Dominio registrado | 2013 |
Datos actualizados 15 de agosto de 2026
¿Qué hace PX-bench?
PX-bench es un benchmark diseñado para medir qué tan bien manejan los agentes de programación de IA las decisiones de experiencia de producto del mundo real, y no solo si el código se ejecuta. La mayoría de los benchmarks de programación se centran únicamente en la corrección, pero PX-bench va más allá: evalúa a los agentes en fidelidad de intención, ajuste de producto, calidad visual, adherencia a convenciones, completitud de rutas, contenido e idioma, resiliencia y accesibilidad. Cada categoría captura el tipo de juicio que haría un diseñador de producto senior al añadir una funcionalidad a una aplicación existente.
La idea clave es que los agentes no construyen desde cero. En su lugar, añaden una funcionalidad a una aplicación anfitriona de varias pantallas que se mantiene reservada y que tiene sus propias convenciones establecidas. Esto obliga al agente a reutilizar componentes, seguir tokens de diseño y colocar las funcionalidades en el contexto adecuado, cosas que no aparecen en una prueba típica de "escribir una función". El benchmark mapea los posibles modos de fallo de antemano y califica las elecciones del agente frente a un resultado satisfactorio definido por diseñadores de producto expertos. Las rúbricas están diseñadas para ser cuasi-objetivas: solo se incluyen cuando los diseñadores senior coinciden en la respuesta correcta.
PX-bench está construido sobre el framework Inspect AI del UK AI Safety Institute, por lo que cualquier escenario puede volver a ejecutarse de forma independiente. Es más útil para equipos que construyen o ajustan agentes de programación que quieran detectar regresiones, reducir costes sin afectar la calidad y entender dónde falla el sentido de producto de su agente. Si estás lanzando un agente que escribe código para usuarios reales, PX-bench te ofrece una tarjeta de puntuación que va más allá de "¿compila?".
Características principales
Qué la hace destacar¿Para quién es PX-bench?
Quién saca más provecho de esta herramientaConfianza y presencia
Alternativas en Pruebas
Plataforma de ingeniería de calidad agéntica basada en IA para pruebas automatizadas en toda la empresa
Plataforma de pruebas para agentes de IA: ejecuta miles de escenarios realistas, recibe feedback de rendimiento en minutos y despliega con confianza.
Librería de Python de código abierto y CLI para probar y evaluar aplicaciones basadas en LLM.
Plataforma de pruebas automatizadas con IA para juegos de Unity: crea bots que imitan el comportamiento real de los jugadores
Plataforma de benchmarking competitivo donde agentes de IA se enfrentan en tareas del mundo real por premios
Evaluación y control de agentes de IA en tiempo real: detecta agentes que fallan en vivo, no después del hecho
Crea evals y benchmarks personalizados para agentes de IA en entornos sandboxed realistas
Plataforma de pruebas para agentes de IA: generación automatizada de pruebas, evaluación semántica y rastreo de producción para agentes de IA.
Herramientas similares
Envía errores, eventos y datos de despliegue en tiempo real a agentes de programación con IA para que corrijan errores y mejoren la UX de forma autónoma.
Plataforma no-code para crear y desplegar sistemas de IA multiagente: conecta distintos LLM, añade datos propios e intégralos en webs y apps de mensajería.
Framework de código abierto para crear agentes de IA que se mejoran a sí mismos de forma recursiva