Benchmark public
Mesuré sur de vraies tâches mémoire avec deux contrôles
Nous mesurons Engram de deux façons : retrouve-t-il la bonne preuve, puis le modèle répond-il correctement avec ce contexte ?
Nous séparons la récupération de preuves et la justesse de réponse. Les deux utilisent LoCoMo public, mais mesurent deux étapes différentes.
Récupération de preuves LoCoMo
Run public complet. Les scores indiquent si la preuve source nécessaire apparaît dans les mémoires récupérées.
| Système | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5427 | 40.95% | 93.29% | 97.59% |
| Mem0 OSS | 0.4314 | 31.25% | 85.16% | 94.79% |
| LangMem / LangGraph | 0.4006 | 28.39% | 83.98% | 94.53% |
| AgentMemory | 0.4627 | 35.68% | 83.33% | N/A |
| Session-file BM25 | 0.1858 | 9.11% | 81.90% | 95.05% |
| BM25 | 0.4676 | 36.39% | 78.19% | 85.74% |
Évaluation des réponses LoCoMo
Chaque ligne utilise l’ensemble complet de 1 536 tâches avec preuves et la même limite top-50. Codex a généré les réponses et un juge aveugle distinct les a notées. Il s’agit d’un diagnostic mené par Engram, pas d’un classement LoCoMo officiel.
| Système | Correct / N | Réponse top-50 |
|---|---|---|
| Engram | 1,377 / 1,536 | 89.65% |
| Mem0 OSS | 1,294 / 1,536 | 84.24% |
| AgentMemory | 1,280 / 1,536 | 83.33% |
| LangMem / LangGraph | 1,279 / 1,536 | 83.27% |
| Session-file BM25 | 1,235 / 1,536 | 80.40% |
| BM25 | 1,227 / 1,536 | 79.88% |
Comment lire les deux tableaux
Les deux évaluations publiées utilisent les 1 536 tâches avec preuves. La recherche exige des identifiants de source et la justesse utilise les mêmes modèles de réponse et d’évaluation pour chaque système inclus. Les systèmes qui ne respectent pas le même protocole sont documentés séparément plutôt que mélangés au classement.
Comment lire les deux tableaux