公开基准

在真实记忆任务上评测 两项检查

我们用两种方式评测 Engram:是否找回正确证据,以及模型能否用这些上下文答对问题。

证据检索和答案准确率分开展示。两项都使用公开 LoCoMo,但衡量记忆流程的不同环节。

1,536
已评分的证据检索问题
93.29%
Engram R@50
89.65%
top-50 上下文答案准确率
+8.13pp
相对第二名系统的 R@50 优势

LoCoMo 证据检索

完整公开运行。分数表示所需源证据是否出现在取回的记忆中。

R@50 比第二名高 +8.13ppN=1,536
系统MRRR@1R@50R@200
Engram0.542740.95%93.29%97.59%
Mem0 OSS0.431431.25%85.16%94.79%
LangMem / LangGraph0.400628.39%83.98%94.53%
AgentMemory0.462735.68%83.33%N/A
Session-file BM250.18589.11%81.90%95.05%
BM250.467636.39%78.19%85.74%

LoCoMo 答案评测

每一行都使用完整的1,536个有证据任务和相同的top-50上限。Codex生成答案,另一个盲审评估器负责评分。这是Engram执行的诊断,并非官方LoCoMo排行榜。

N=1,536
系统正确 / NTop-50 答案
Engram1,377 / 1,53689.65%
Mem0 OSS1,294 / 1,53684.24%
AgentMemory1,280 / 1,53683.33%
LangMem / LangGraph1,279 / 1,53683.27%
Session-file BM251,235 / 1,53680.40%
BM251,227 / 1,53679.88%
?

如何理解两张表

两项公开评估都使用全部1,536个有证据任务。证据检索要求来源ID,所有纳入的系统使用相同的回答模型和评审模型。不满足同一评估协议的系统会单独记录,而不会混入排名。

如何理解两张表

支持和反馈

帮助我们改进 Engram

如果 setup 让人困惑、工具行为异常或价格限制看起来不对,请在这里告诉我们。消息会直接到我们这里。

支持和反馈

我们该改进什么?

Bug、混乱的 setup 步骤、价格问题和产品想法都会直接发送给 Engram 团队。

还需要 10 个字符0/10