Публичный benchmark

Методика тестирования Engram

Изучите открытые наборы данных, метрики поиска, проверки ответов, базовые методы, ограничения и правила публикации результатов.

LoCoMo retrieval доказательств92.19%
LoCoMo оценка ответов66.33%
Как это работает
01

LoCoMo retrieval доказательств

Полный публичный запуск. Scores показывают, находится ли нужный источник среди retrieved memories.

02

LoCoMo оценка ответов

Диагностика Codex/self-review на одних и тех же 98 задачах. Оценивает, верен ли ответ, сгенерированный из найденного контекста.

03

Как читать R@200 и Top-200

Поиск доказательств кумулятивен: R@200 включает всё из R@50 плюс дополнительные кандидаты, поэтому не должен быть ниже. Точность ответа устроена иначе. Больше контекста может добавить шум или противоречивые memories; Top-50 иногда дает более чистый ответ, а Top-200 проверяет, остается ли упаковка контекста полезной при большем числе доказательств.

1,536

оцененных вопросов retrieval

92.19%

Engram R@50

66.33%

точность ответа по top-50 контексту

Retrieval доказательств и точность ответа разделены. Оба теста используют публичный LoCoMo, но измеряют разные части memory loop.

LoCoMo ↗

Мы измеряем Engram двумя способами: находит ли он нужное доказательство и может ли LLM правильно ответить по найденному контексту.

Retrieval доказательств и точность ответа разделены. Оба теста используют публичный LoCoMo, но измеряют разные части memory loop.

Поддержка и обратная связь

Помогите нам улучшить Engram

Если setup запутан, tool ведет себя странно или лимит тарифа кажется неверным, напишите здесь. Сообщение попадет прямо к нам.

Поддержка и обратная связь

Что улучшить?

Баги, непонятные setup-шаги, вопросы по pricing и продуктовые идеи идут прямо команде Engram.

Нужно еще 10 символов0/10