公开基准

在真实记忆任务上评测 两项检查

我们用两种方式评测 Engram:是否找回正确证据,以及模型能否用这些上下文答对问题。

证据检索和答案准确率分开展示。两项都使用公开 LoCoMo,但衡量记忆流程的不同环节。

1,536
已评分的证据检索问题
92.19%
Engram R@50
66.33%
top-50 上下文答案准确率
+8.21pp
相对 LangMem 的 R@50 优势

LoCoMo 证据检索

完整公开运行。分数表示所需源证据是否出现在取回的记忆中。

R@50 比第二名高 +8.21ppN=1,536
系统MRRR@1R@50R@200
Engram0.534540.63%92.19%97.66%
LangMem / LangGraph0.400228.32%83.98%94.53%
Mem0 OSS0.399928.32%83.92%94.27%
AgentMemory0.427033.20%79.10%84.96%
BM250.467634.57%78.19%85.74%

LoCoMo 答案评测

在同一组 98 个任务上进行 Codex/self-review 诊断。衡量模型基于取回上下文生成的答案是否正确。

N=98
系统Top-50 答案Top-200 答案相对基础模型
Engram66.33%59.18%+56.13pp
Session-file BM2561.22%53.06%+51.02pp
Mem0 OSS55.10%57.14%+44.90pp
BM2548.98%44.90%+38.78pp
LangMem / LangGraph46.94%52.04%+36.74pp
No memory10.20%9.18%baseline
?

如何理解 R@200 和 Top-200

证据检索是累积指标:R@200 包含 R@50 找到的内容以及更多证据,因此不应更低。答案准确率不同。更多上下文也可能带来噪声或冲突记忆;Top-50 有时回答更干净,Top-200 则测试在更多证据下上下文打包是否仍然有用。

支持和反馈

帮助我们改进 Engram

如果 setup 让人困惑、工具行为异常或价格限制看起来不对,请在这里告诉我们。消息会直接到我们这里。

支持和反馈

我们该改进什么?

Bug、混乱的 setup 步骤、价格问题和产品想法都会直接发送给 Engram 团队。

还需要 10 个字符0/10