공개 벤치마크

실제 메모리 작업에서 측정 두 가지 검증

Engram은 올바른 근거를 찾는지, 그리고 그 문맥으로 LLM이 올바르게 답하는지를 따로 측정합니다.

근거 검색과 답변 정확도는 분리해서 보여줍니다. 둘 다 공개 LoCoMo를 쓰지만 메모리 루프의 다른 단계를 봅니다.

1,536
채점된 근거 검색 질문
93.29%
Engram R@50
89.65%
top-50 문맥 답변 정확도
+8.13pp
R@50 2위 시스템 대비 우위

LoCoMo 근거 검색

전체 공개 실행입니다. 필요한 원문 근거가 검색된 메모리에 포함되는지 보여줍니다.

R@50 2위보다 +8.13ppN=1,536
시스템MRRR@1R@50R@200
Engram0.542740.95%93.29%97.59%
Mem0 OSS0.431431.25%85.16%94.79%
LangMem / LangGraph0.400628.39%83.98%94.53%
AgentMemory0.462735.68%83.33%N/A
Session-file BM250.18589.11%81.90%95.05%
BM250.467636.39%78.19%85.74%

LoCoMo 답변 평가

모든 행은 증거가 있는 1,536개 작업 전체와 같은 top-50 기준을 사용합니다. Codex가 답을 생성했고 별도의 블라인드 평가자가 채점했습니다. Engram이 실행한 진단이며 공식 LoCoMo 순위표가 아닙니다.

N=1,536
시스템정답 / NTop-50 답변
Engram1,377 / 1,53689.65%
Mem0 OSS1,294 / 1,53684.24%
AgentMemory1,280 / 1,53683.33%
LangMem / LangGraph1,279 / 1,53683.27%
Session-file BM251,235 / 1,53680.40%
BM251,227 / 1,53679.88%
?

두 표를 읽는 방법

공개된 두 평가는 증거가 있는 1,536개 작업 전체를 사용합니다. 증거 검색에는 원본 ID가 필요하며 포함된 모든 시스템에 동일한 답변 모델과 판정 모델을 사용합니다. 같은 평가 조건을 충족하지 않는 시스템은 순위에 섞지 않고 별도로 기록합니다.

두 표를 읽는 방법

지원 및 피드백

Engram 개선에 의견 보내기

setup이 헷갈리거나 tool이 이상하게 동작하거나 pricing limit가 잘못된 것 같으면 여기로 보내세요. 메시지는 바로 우리에게 옵니다.

지원 및 피드백

무엇을 개선할까요?

Bugs, confusing setup steps, pricing questions, product ideas가 Engram team으로 바로 전달됩니다.

10자 더 필요합니다0/10