Публичный benchmark

Измерено на реальных задачах памяти двумя проверками

Мы измеряем Engram двумя способами: находит ли он нужное доказательство и может ли LLM правильно ответить по найденному контексту.

Retrieval доказательств и точность ответа разделены. Оба теста используют публичный LoCoMo, но измеряют разные части memory loop.

1,536
оцененных вопросов retrieval
92.19%
Engram R@50
66.33%
точность ответа по top-50 контексту
+8.21pp
преимущество R@50 над LangMem

LoCoMo retrieval доказательств

Полный публичный запуск. Scores показывают, находится ли нужный источник среди retrieved memories.

+8,21 п.п. к следующему R@50N=1,536
СистемаMRRR@1R@50R@200
Engram0.534540.63%92.19%97.66%
LangMem / LangGraph0.400228.32%83.98%94.53%
Mem0 OSS0.399928.32%83.92%94.27%
AgentMemory0.427033.20%79.10%84.96%
BM250.467634.57%78.19%85.74%

LoCoMo оценка ответов

Диагностика Codex/self-review на одних и тех же 98 задачах. Оценивает, верен ли ответ, сгенерированный из найденного контекста.

N=98
СистемаОтвет top-50Ответ top-200к базовой модели
Engram66.33%59.18%+56.13pp
Session-file BM2561.22%53.06%+51.02pp
Mem0 OSS55.10%57.14%+44.90pp
BM2548.98%44.90%+38.78pp
LangMem / LangGraph46.94%52.04%+36.74pp
No memory10.20%9.18%baseline
?

Как читать R@200 и Top-200

Поиск доказательств кумулятивен: R@200 включает всё из R@50 плюс дополнительные кандидаты, поэтому не должен быть ниже. Точность ответа устроена иначе. Больше контекста может добавить шум или противоречивые memories; Top-50 иногда дает более чистый ответ, а Top-200 проверяет, остается ли упаковка контекста полезной при большем числе доказательств.

Поддержка и обратная связь

Помогите нам улучшить Engram

Если setup запутан, tool ведет себя странно или лимит тарифа кажется неверным, напишите здесь. Сообщение попадет прямо к нам.

Поддержка и обратная связь

Что улучшить?

Баги, непонятные setup-шаги, вопросы по pricing и продуктовые идеи идут прямо команде Engram.

Нужно еще 10 символов0/10