공개 벤치마크

실제 메모리 작업에서 측정 두 가지 검증

Engram은 올바른 근거를 찾는지, 그리고 그 문맥으로 LLM이 올바르게 답하는지를 따로 측정합니다.

근거 검색과 답변 정확도는 분리해서 보여줍니다. 둘 다 공개 LoCoMo를 쓰지만 메모리 루프의 다른 단계를 봅니다.

1,536
채점된 근거 검색 질문
92.19%
Engram R@50
66.33%
top-50 문맥 답변 정확도
+8.21pp
LangMem 대비 R@50 우위

LoCoMo 근거 검색

전체 공개 실행입니다. 필요한 원문 근거가 검색된 메모리에 포함되는지 보여줍니다.

R@50 2위보다 +8.21ppN=1,536
시스템MRRR@1R@50R@200
Engram0.534540.63%92.19%97.66%
LangMem / LangGraph0.400228.32%83.98%94.53%
Mem0 OSS0.399928.32%83.92%94.27%
AgentMemory0.427033.20%79.10%84.96%
BM250.467634.57%78.19%85.74%

LoCoMo 답변 평가

같은 98개 작업에서 Codex/self-review로 진단했습니다. 검색된 문맥에서 생성한 답이 맞는지 평가합니다.

N=98
시스템Top-50 답변Top-200 답변기본 모델 대비
Engram66.33%59.18%+56.13pp
Session-file BM2561.22%53.06%+51.02pp
Mem0 OSS55.10%57.14%+44.90pp
BM2548.98%44.90%+38.78pp
LangMem / LangGraph46.94%52.04%+36.74pp
No memory10.20%9.18%baseline
?

R@200과 Top-200 읽는 법

증거 검색은 누적 지표입니다. R@200은 R@50이 찾은 것에 더 많은 증거를 포함하므로 낮아지면 안 됩니다. 답변 정확도는 다릅니다. 더 많은 context는 noise나 충돌하는 memory를 함께 가져올 수 있습니다. Top-50은 더 깔끔한 답을 줄 수 있고, Top-200은 더 많은 증거에서도 packaging이 유용한지 봅니다.

지원 및 피드백

Engram 개선에 의견 보내기

setup이 헷갈리거나 tool이 이상하게 동작하거나 pricing limit가 잘못된 것 같으면 여기로 보내세요. 메시지는 바로 우리에게 옵니다.

지원 및 피드백

무엇을 개선할까요?

Bugs, confusing setup steps, pricing questions, product ideas가 Engram team으로 바로 전달됩니다.

10자 더 필요합니다0/10