公开基准
在真实记忆任务上评测 两项检查
我们用两种方式评测 Engram:是否找回正确证据,以及模型能否用这些上下文答对问题。
证据检索和答案准确率分开展示。两项都使用公开 LoCoMo,但衡量记忆流程的不同环节。
1,536
已评分的证据检索问题
93.29%
Engram R@50
89.65%
top-50 上下文答案准确率
+8.13pp
相对第二名系统的 R@50 优势
LoCoMo 证据检索
完整公开运行。分数表示所需源证据是否出现在取回的记忆中。
R@50 比第二名高 +8.13ppN=1,536
| 系统 | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5427 | 40.95% | 93.29% | 97.59% |
| Mem0 OSS | 0.4314 | 31.25% | 85.16% | 94.79% |
| LangMem / LangGraph | 0.4006 | 28.39% | 83.98% | 94.53% |
| AgentMemory | 0.4627 | 35.68% | 83.33% | N/A |
| Session-file BM25 | 0.1858 | 9.11% | 81.90% | 95.05% |
| BM25 | 0.4676 | 36.39% | 78.19% | 85.74% |
LoCoMo 答案评测
每一行都使用完整的1,536个有证据任务和相同的top-50上限。Codex生成答案,另一个盲审评估器负责评分。这是Engram执行的诊断,并非官方LoCoMo排行榜。
| 系统 | 正确 / N | Top-50 答案 |
|---|---|---|
| Engram | 1,377 / 1,536 | 89.65% |
| Mem0 OSS | 1,294 / 1,536 | 84.24% |
| AgentMemory | 1,280 / 1,536 | 83.33% |
| LangMem / LangGraph | 1,279 / 1,536 | 83.27% |
| Session-file BM25 | 1,235 / 1,536 | 80.40% |
| BM25 | 1,227 / 1,536 | 79.88% |