← All news

MarathonMemBench — бенчмарк нового типа для тестирования памяти вашего LLM-агента

Эта статья — про долговременную память AI-агентов и про то, как её измерить. Я сделал MarathonMemBench — платформу, где LLM-персона часами беседует с тестируемым агентом: рассказывает факты о своей жизни, меняет решения, путается и поправляется, а под конец — когда начало разговора давно вытеснено из контекста — устраивает экзамен на всё сказанное. Подключить можно любого агента, у которого есть чат, — больше от него ничего не требуется. Дальше будут: обзор существующих бенчмарков памяти и почему каждый из них требует дорабатывать агента под себя, устройство платформы, результаты open-source-агентов — неожиданно сильные — и вскрытие их памяти после прогонов.

Читать далее
Read original at Хабр — Искусственный интеллект →