공개 벤치마크
실제 메모리 작업에서 측정 두 가지 검증
Engram은 올바른 근거를 찾는지, 그리고 그 문맥으로 LLM이 올바르게 답하는지를 따로 측정합니다.
근거 검색과 답변 정확도는 분리해서 보여줍니다. 둘 다 공개 LoCoMo를 쓰지만 메모리 루프의 다른 단계를 봅니다.
1,536
채점된 근거 검색 질문
92.19%
Engram R@50
66.33%
top-50 문맥 답변 정확도
+8.21pp
LangMem 대비 R@50 우위
LoCoMo 근거 검색
전체 공개 실행입니다. 필요한 원문 근거가 검색된 메모리에 포함되는지 보여줍니다.
R@50 2위보다 +8.21ppN=1,536
| 시스템 | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5345 | 40.63% | 92.19% | 97.66% |
| LangMem / LangGraph | 0.4002 | 28.32% | 83.98% | 94.53% |
| Mem0 OSS | 0.3999 | 28.32% | 83.92% | 94.27% |
| AgentMemory | 0.4270 | 33.20% | 79.10% | 84.96% |
| BM25 | 0.4676 | 34.57% | 78.19% | 85.74% |
LoCoMo 답변 평가
같은 98개 작업에서 Codex/self-review로 진단했습니다. 검색된 문맥에서 생성한 답이 맞는지 평가합니다.
| 시스템 | Top-50 답변 | Top-200 답변 | 기본 모델 대비 |
|---|---|---|---|
| Engram | 66.33% | 59.18% | +56.13pp |
| Session-file BM25 | 61.22% | 53.06% | +51.02pp |
| Mem0 OSS | 55.10% | 57.14% | +44.90pp |
| BM25 | 48.98% | 44.90% | +38.78pp |
| LangMem / LangGraph | 46.94% | 52.04% | +36.74pp |
| No memory | 10.20% | 9.18% | baseline |
?
R@200과 Top-200 읽는 법
증거 검색은 누적 지표입니다. R@200은 R@50이 찾은 것에 더 많은 증거를 포함하므로 낮아지면 안 됩니다. 답변 정확도는 다릅니다. 더 많은 context는 noise나 충돌하는 memory를 함께 가져올 수 있습니다. Top-50은 더 깔끔한 답을 줄 수 있고, Top-200은 더 많은 증거에서도 packaging이 유용한지 봅니다.