Публичный benchmark
Измерено на реальных задачах памяти двумя проверками
Мы измеряем Engram двумя способами: находит ли он нужное доказательство и может ли LLM правильно ответить по найденному контексту.
Retrieval доказательств и точность ответа разделены. Оба теста используют публичный LoCoMo, но измеряют разные части memory loop.
LoCoMo retrieval доказательств
Полный публичный запуск. Scores показывают, находится ли нужный источник среди retrieved memories.
| Система | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5427 | 40.95% | 93.29% | 97.59% |
| Mem0 OSS | 0.4314 | 31.25% | 85.16% | 94.79% |
| LangMem / LangGraph | 0.4006 | 28.39% | 83.98% | 94.53% |
| AgentMemory | 0.4627 | 35.68% | 83.33% | N/A |
| Session-file BM25 | 0.1858 | 9.11% | 81.90% | 95.05% |
| BM25 | 0.4676 | 36.39% | 78.19% | 85.74% |
LoCoMo оценка ответов
Каждая строка использует полный набор из 1 536 задач с доказательствами и одинаковый предел top-50. Codex создал ответы, а отдельный слепой судья их оценил. Это диагностика, проведённая Engram, а не официальный рейтинг LoCoMo.
| Система | Верно / N | Ответ top-50 |
|---|---|---|
| Engram | 1,377 / 1,536 | 89.65% |
| Mem0 OSS | 1,294 / 1,536 | 84.24% |
| AgentMemory | 1,280 / 1,536 | 83.33% |
| LangMem / LangGraph | 1,279 / 1,536 | 83.27% |
| Session-file BM25 | 1,235 / 1,536 | 80.40% |
| BM25 | 1,227 / 1,536 | 79.88% |
Как читать две таблицы
Обе опубликованные оценки используют все 1 536 задач с доказательствами. Для поиска нужны идентификаторы источников, а для каждого включённого сервиса используются одинаковые модели ответа и оценки. Системы, не соответствующие тому же протоколу, документируются отдельно и не смешиваются с рейтингом.
Как читать две таблицы