公開ベンチマーク
実際の記憶タスクで測定 2つの評価
Engram は、正しい証拠を取得できるか、そしてその文脈から LLM が正しく答えられるかの2つで測定しています。
証拠検索と回答精度は分けて表示します。どちらも公開 LoCoMo を使いますが、記憶ループの別の部分を測ります。
1,536
採点済み証拠検索質問
92.19%
Engram R@50
66.33%
top-50文脈での回答精度
+8.21pp
LangMemに対するR@50差
LoCoMo 証拠検索
公開データでのフル実行。必要な証拠が取得された記憶に含まれるかを示します。
R@50 で2位に +8.21ppN=1,536
| システム | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5345 | 40.63% | 92.19% | 97.66% |
| LangMem / LangGraph | 0.4002 | 28.32% | 83.98% | 94.53% |
| Mem0 OSS | 0.3999 | 28.32% | 83.92% | 94.27% |
| AgentMemory | 0.4270 | 33.20% | 79.10% | 84.96% |
| BM25 | 0.4676 | 34.57% | 78.19% | 85.74% |
LoCoMo 回答評価
同じ98タスクでCodex/self-review診断を行いました。取得文脈から生成した回答が正しいかを評価します。
| システム | Top-50回答 | Top-200回答 | ベースモデル比 |
|---|---|---|---|
| Engram | 66.33% | 59.18% | +56.13pp |
| Session-file BM25 | 61.22% | 53.06% | +51.02pp |
| Mem0 OSS | 55.10% | 57.14% | +44.90pp |
| BM25 | 48.98% | 44.90% | +38.78pp |
| LangMem / LangGraph | 46.94% | 52.04% | +36.74pp |
| No memory | 10.20% | 9.18% | baseline |
?
R@200 と Top-200 の読み方
証拠検索は累積指標です。R@200 は R@50 が見つけたものに追加証拠を含むため、低くなるべきではありません。回答精度は別です。文脈が増えるとノイズや矛盾する memory も増えます。Top-50 はよりきれいに答えることがあり、Top-200 は証拠が増えても context packaging が有用かを測ります。