公開ベンチマーク
実際の記憶タスクで測定 2つの評価
Engram は、正しい証拠を取得できるか、そしてその文脈から LLM が正しく答えられるかの2つで測定しています。
証拠検索と回答精度は分けて表示します。どちらも公開 LoCoMo を使いますが、記憶ループの別の部分を測ります。
1,536
採点済み証拠検索質問
93.29%
Engram R@50
89.65%
top-50文脈での回答精度
+8.13pp
R@50で2位のシステムとの差
LoCoMo 証拠検索
公開データでのフル実行。必要な証拠が取得された記憶に含まれるかを示します。
R@50 で2位に +8.13ppN=1,536
| システム | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5427 | 40.95% | 93.29% | 97.59% |
| Mem0 OSS | 0.4314 | 31.25% | 85.16% | 94.79% |
| LangMem / LangGraph | 0.4006 | 28.39% | 83.98% | 94.53% |
| AgentMemory | 0.4627 | 35.68% | 83.33% | N/A |
| Session-file BM25 | 0.1858 | 9.11% | 81.90% | 95.05% |
| BM25 | 0.4676 | 36.39% | 78.19% | 85.74% |
LoCoMo 回答評価
全行で証拠のある1,536タスクすべてと同じtop-50上限を使いました。Codexが回答を生成し、別のブラインド判定者が採点しました。これはEngramが実施した診断であり、公式LoCoMoランキングではありません。
| システム | 正解 / N | Top-50回答 |
|---|---|---|
| Engram | 1,377 / 1,536 | 89.65% |
| Mem0 OSS | 1,294 / 1,536 | 84.24% |
| AgentMemory | 1,280 / 1,536 | 83.33% |
| LangMem / LangGraph | 1,279 / 1,536 | 83.27% |
| Session-file BM25 | 1,235 / 1,536 | 80.40% |
| BM25 | 1,227 / 1,536 | 79.88% |
?
2つの表の読み方
公開する2つの評価はいずれも証拠のある1,536タスクすべてを使います。証拠検索にはソースIDが必要で、含まれる各システムには同じ回答モデルと判定モデルを使います。同じ評価条件を満たさないシステムはランキングに混ぜず、別途記録します。
2つの表の読み方