LoCoMo retrieval доказательств
Полный публичный запуск. Scores показывают, находится ли нужный источник среди retrieved memories.
Публичный benchmark
Изучите открытые наборы данных, метрики поиска, проверки ответов, базовые методы, ограничения и правила публикации результатов.
Полный публичный запуск. Scores показывают, находится ли нужный источник среди retrieved memories.
Диагностика Codex/self-review на одних и тех же 98 задачах. Оценивает, верен ли ответ, сгенерированный из найденного контекста.
Поиск доказательств кумулятивен: R@200 включает всё из R@50 плюс дополнительные кандидаты, поэтому не должен быть ниже. Точность ответа устроена иначе. Больше контекста может добавить шум или противоречивые memories; Top-50 иногда дает более чистый ответ, а Top-200 проверяет, остается ли упаковка контекста полезной при большем числе доказательств.
оцененных вопросов retrieval
Engram R@50
точность ответа по top-50 контексту
Retrieval доказательств и точность ответа разделены. Оба теста используют публичный LoCoMo, но измеряют разные части memory loop.
LoCoMo ↗Retrieval доказательств и точность ответа разделены. Оба теста используют публичный LoCoMo, но измеряют разные части memory loop.
Поддержка и обратная связь
Если setup запутан, tool ведет себя странно или лимит тарифа кажется неверным, напишите здесь. Сообщение попадет прямо к нам.