Benchmark público
Medido em tarefas reais de memória com duas checagens
Medimos o Engram de duas formas: se ele recupera a evidência certa e se um LLM responde corretamente com esse contexto.
Mantemos recuperação de evidência e precisão da resposta separadas. Ambas usam o LoCoMo público, mas medem partes diferentes do ciclo de memória.
Recuperação de evidências LoCoMo
Execução pública completa. Os scores mostram se a evidência necessária aparece nas memórias recuperadas.
| Sistema | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5427 | 40.95% | 93.29% | 97.59% |
| Mem0 OSS | 0.4314 | 31.25% | 85.16% | 94.79% |
| LangMem / LangGraph | 0.4006 | 28.39% | 83.98% | 94.53% |
| AgentMemory | 0.4627 | 35.68% | 83.33% | N/A |
| Session-file BM25 | 0.1858 | 9.11% | 81.90% | 95.05% |
| BM25 | 0.4676 | 36.39% | 78.19% | 85.74% |
Avaliação de resposta LoCoMo
Cada linha usa o conjunto completo de 1.536 tarefas com evidências e o mesmo limite top-50. O Codex gerou as respostas e um avaliador cego separado as pontuou. Este é um diagnóstico executado pela Engram, não um ranking oficial do LoCoMo.
| Sistema | Corretas / N | Resposta top-50 |
|---|---|---|
| Engram | 1,377 / 1,536 | 89.65% |
| Mem0 OSS | 1,294 / 1,536 | 84.24% |
| AgentMemory | 1,280 / 1,536 | 83.33% |
| LangMem / LangGraph | 1,279 / 1,536 | 83.27% |
| Session-file BM25 | 1,235 / 1,536 | 80.40% |
| BM25 | 1,227 / 1,536 | 79.88% |
Como ler as duas tabelas
As duas avaliações publicadas usam todas as 1.536 tarefas com evidências. A recuperação exige IDs de origem, e a precisão usa os mesmos modelos de resposta e avaliação para cada sistema incluído. Sistemas que não cumprem o mesmo protocolo são documentados separadamente, em vez de misturados ao ranking.
Como ler as duas tabelas