LoCoMo 証拠検索
公開データでのフル実行。必要な証拠が取得された記憶に含まれるかを示します。
公開ベンチマーク
公開結果の根拠となるデータセット、検索指標、回答評価、ベースライン、制約、主張ルールを確認できます。
公開データでのフル実行。必要な証拠が取得された記憶に含まれるかを示します。
同じ98タスクでCodex/self-review診断を行いました。取得文脈から生成した回答が正しいかを評価します。
証拠検索は累積指標です。R@200 は R@50 が見つけたものに追加証拠を含むため、低くなるべきではありません。回答精度は別です。文脈が増えるとノイズや矛盾する memory も増えます。Top-50 はよりきれいに答えることがあり、Top-200 は証拠が増えても context packaging が有用かを測ります。
採点済み証拠検索質問
Engram R@50
top-50文脈での回答精度
証拠検索と回答精度は分けて表示します。どちらも公開 LoCoMo を使いますが、記憶ループの別の部分を測ります。
LoCoMo ↗サポートとフィードバック
setup が分かりにくい、tool の挙動がおかしい、pricing limit が違うと感じる場合はここに送ってください。メッセージは直接届きます。