Benchmark público
Medido em tarefas reais de memória com duas checagens
Medimos o Engram de duas formas: se ele recupera a evidência certa e se um LLM responde corretamente com esse contexto.
Mantemos recuperação de evidência e precisão da resposta separadas. Ambas usam o LoCoMo público, mas medem partes diferentes do ciclo de memória.
Recuperação de evidências LoCoMo
Execução pública completa. Os scores mostram se a evidência necessária aparece nas memórias recuperadas.
| Sistema | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5345 | 40.63% | 92.19% | 97.66% |
| LangMem / LangGraph | 0.4002 | 28.32% | 83.98% | 94.53% |
| Mem0 OSS | 0.3999 | 28.32% | 83.92% | 94.27% |
| AgentMemory | 0.4270 | 33.20% | 79.10% | 84.96% |
| BM25 | 0.4676 | 34.57% | 78.19% | 85.74% |
Avaliação de resposta LoCoMo
Diagnóstico revisado por Codex/self-review nas mesmas 98 tarefas. Mede se a resposta gerada a partir do contexto recuperado está correta.
| Sistema | Resposta top-50 | Resposta top-200 | vs modelo base |
|---|---|---|---|
| Engram | 66.33% | 59.18% | +56.13pp |
| Session-file BM25 | 61.22% | 53.06% | +51.02pp |
| Mem0 OSS | 55.10% | 57.14% | +44.90pp |
| BM25 | 48.98% | 44.90% | +38.78pp |
| LangMem / LangGraph | 46.94% | 52.04% | +36.74pp |
| No memory | 10.20% | 9.18% | baseline |
Como ler R@200 e Top-200
A recuperação de evidências é cumulativa: R@200 inclui o que R@50 encontrou e mais, então não deveria ser menor. Precisão de resposta é diferente. Mais contexto também pode trazer ruído ou memórias conflitantes; Top-50 pode responder de forma mais limpa, enquanto Top-200 testa se o empacotamento continua útil com mais evidência.