Benchmark public
Mesuré sur de vraies tâches mémoire avec deux contrôles
Nous mesurons Engram de deux façons : retrouve-t-il la bonne preuve, puis le modèle répond-il correctement avec ce contexte ?
Nous séparons la récupération de preuves et la justesse de réponse. Les deux utilisent LoCoMo public, mais mesurent deux étapes différentes.
Récupération de preuves LoCoMo
Run public complet. Les scores indiquent si la preuve source nécessaire apparaît dans les mémoires récupérées.
| Système | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5345 | 40.63% | 92.19% | 97.66% |
| LangMem / LangGraph | 0.4002 | 28.32% | 83.98% | 94.53% |
| Mem0 OSS | 0.3999 | 28.32% | 83.92% | 94.27% |
| AgentMemory | 0.4270 | 33.20% | 79.10% | 84.96% |
| BM25 | 0.4676 | 34.57% | 78.19% | 85.74% |
Évaluation des réponses LoCoMo
Diagnostic relu par Codex/self-review sur les mêmes 98 tâches. Mesure si la réponse générée depuis le contexte récupéré est correcte.
| Système | Réponse top-50 | Réponse top-200 | vs modèle de base |
|---|---|---|---|
| Engram | 66.33% | 59.18% | +56.13pp |
| Session-file BM25 | 61.22% | 53.06% | +51.02pp |
| Mem0 OSS | 55.10% | 57.14% | +44.90pp |
| BM25 | 48.98% | 44.90% | +38.78pp |
| LangMem / LangGraph | 46.94% | 52.04% | +36.74pp |
| No memory | 10.20% | 9.18% | baseline |
Comment lire R@200 et Top-200
La récupération de preuves est cumulative : R@200 inclut ce que R@50 trouve, plus davantage, donc il ne devrait pas être plus bas. La précision de réponse est différente. Plus de contexte peut ajouter du bruit ou des mémoires contradictoires; Top-50 peut répondre plus proprement, tandis que Top-200 teste si le packaging reste utile avec plus de preuves.