公开基准
在真实记忆任务上评测 两项检查
我们用两种方式评测 Engram:是否找回正确证据,以及模型能否用这些上下文答对问题。
证据检索和答案准确率分开展示。两项都使用公开 LoCoMo,但衡量记忆流程的不同环节。
1,536
已评分的证据检索问题
92.19%
Engram R@50
66.33%
top-50 上下文答案准确率
+8.21pp
相对 LangMem 的 R@50 优势
LoCoMo 证据检索
完整公开运行。分数表示所需源证据是否出现在取回的记忆中。
R@50 比第二名高 +8.21ppN=1,536
| 系统 | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5345 | 40.63% | 92.19% | 97.66% |
| LangMem / LangGraph | 0.4002 | 28.32% | 83.98% | 94.53% |
| Mem0 OSS | 0.3999 | 28.32% | 83.92% | 94.27% |
| AgentMemory | 0.4270 | 33.20% | 79.10% | 84.96% |
| BM25 | 0.4676 | 34.57% | 78.19% | 85.74% |
LoCoMo 答案评测
在同一组 98 个任务上进行 Codex/self-review 诊断。衡量模型基于取回上下文生成的答案是否正确。
| 系统 | Top-50 答案 | Top-200 答案 | 相对基础模型 |
|---|---|---|---|
| Engram | 66.33% | 59.18% | +56.13pp |
| Session-file BM25 | 61.22% | 53.06% | +51.02pp |
| Mem0 OSS | 55.10% | 57.14% | +44.90pp |
| BM25 | 48.98% | 44.90% | +38.78pp |
| LangMem / LangGraph | 46.94% | 52.04% | +36.74pp |
| No memory | 10.20% | 9.18% | baseline |
?
如何理解 R@200 和 Top-200
证据检索是累积指标:R@200 包含 R@50 找到的内容以及更多证据,因此不应更低。答案准确率不同。更多上下文也可能带来噪声或冲突记忆;Top-50 有时回答更干净,Top-200 则测试在更多证据下上下文打包是否仍然有用。