공개 벤치마크
실제 메모리 작업에서 측정 두 가지 검증
Engram은 올바른 근거를 찾는지, 그리고 그 문맥으로 LLM이 올바르게 답하는지를 따로 측정합니다.
근거 검색과 답변 정확도는 분리해서 보여줍니다. 둘 다 공개 LoCoMo를 쓰지만 메모리 루프의 다른 단계를 봅니다.
1,536
채점된 근거 검색 질문
93.29%
Engram R@50
89.65%
top-50 문맥 답변 정확도
+8.13pp
R@50 2위 시스템 대비 우위
LoCoMo 근거 검색
전체 공개 실행입니다. 필요한 원문 근거가 검색된 메모리에 포함되는지 보여줍니다.
R@50 2위보다 +8.13ppN=1,536
| 시스템 | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5427 | 40.95% | 93.29% | 97.59% |
| Mem0 OSS | 0.4314 | 31.25% | 85.16% | 94.79% |
| LangMem / LangGraph | 0.4006 | 28.39% | 83.98% | 94.53% |
| AgentMemory | 0.4627 | 35.68% | 83.33% | N/A |
| Session-file BM25 | 0.1858 | 9.11% | 81.90% | 95.05% |
| BM25 | 0.4676 | 36.39% | 78.19% | 85.74% |
LoCoMo 답변 평가
모든 행은 증거가 있는 1,536개 작업 전체와 같은 top-50 기준을 사용합니다. Codex가 답을 생성했고 별도의 블라인드 평가자가 채점했습니다. Engram이 실행한 진단이며 공식 LoCoMo 순위표가 아닙니다.
| 시스템 | 정답 / N | Top-50 답변 |
|---|---|---|
| Engram | 1,377 / 1,536 | 89.65% |
| Mem0 OSS | 1,294 / 1,536 | 84.24% |
| AgentMemory | 1,280 / 1,536 | 83.33% |
| LangMem / LangGraph | 1,279 / 1,536 | 83.27% |
| Session-file BM25 | 1,235 / 1,536 | 80.40% |
| BM25 | 1,227 / 1,536 | 79.88% |
?
두 표를 읽는 방법
공개된 두 평가는 증거가 있는 1,536개 작업 전체를 사용합니다. 증거 검색에는 원본 ID가 필요하며 포함된 모든 시스템에 동일한 답변 모델과 판정 모델을 사용합니다. 같은 평가 조건을 충족하지 않는 시스템은 순위에 섞지 않고 별도로 기록합니다.
두 표를 읽는 방법