公開ベンチマーク

実際の記憶タスクで測定 2つの評価

Engram は、正しい証拠を取得できるか、そしてその文脈から LLM が正しく答えられるかの2つで測定しています。

証拠検索と回答精度は分けて表示します。どちらも公開 LoCoMo を使いますが、記憶ループの別の部分を測ります。

1,536
採点済み証拠検索質問
93.29%
Engram R@50
89.65%
top-50文脈での回答精度
+8.13pp
R@50で2位のシステムとの差

LoCoMo 証拠検索

公開データでのフル実行。必要な証拠が取得された記憶に含まれるかを示します。

R@50 で2位に +8.13ppN=1,536
システムMRRR@1R@50R@200
Engram0.542740.95%93.29%97.59%
Mem0 OSS0.431431.25%85.16%94.79%
LangMem / LangGraph0.400628.39%83.98%94.53%
AgentMemory0.462735.68%83.33%N/A
Session-file BM250.18589.11%81.90%95.05%
BM250.467636.39%78.19%85.74%

LoCoMo 回答評価

全行で証拠のある1,536タスクすべてと同じtop-50上限を使いました。Codexが回答を生成し、別のブラインド判定者が採点しました。これはEngramが実施した診断であり、公式LoCoMoランキングではありません。

N=1,536
システム正解 / NTop-50回答
Engram1,377 / 1,53689.65%
Mem0 OSS1,294 / 1,53684.24%
AgentMemory1,280 / 1,53683.33%
LangMem / LangGraph1,279 / 1,53683.27%
Session-file BM251,235 / 1,53680.40%
BM251,227 / 1,53679.88%
?

2つの表の読み方

公開する2つの評価はいずれも証拠のある1,536タスクすべてを使います。証拠検索にはソースIDが必要で、含まれる各システムには同じ回答モデルと判定モデルを使います。同じ評価条件を満たさないシステムはランキングに混ぜず、別途記録します。

2つの表の読み方

サポートとフィードバック

Engram の改善に協力する

setup が分かりにくい、tool の挙動がおかしい、pricing limit が違うと感じる場合はここに送ってください。メッセージは直接届きます。

サポートとフィードバック

何を改善しますか?

Bugs、分かりにくい setup steps、pricing questions、product ideas は Engram team に直接届きます。

あと 10 文字必要です0/10