Benchmark público

Medido em tarefas reais de memória com duas checagens

Medimos o Engram de duas formas: se ele recupera a evidência certa e se um LLM responde corretamente com esse contexto.

Mantemos recuperação de evidência e precisão da resposta separadas. Ambas usam o LoCoMo público, mas medem partes diferentes do ciclo de memória.

1,536
perguntas pontuadas de recuperação
92.19%
Engram R@50
66.33%
precisão com contexto top-50
+8.21pp
vantagem R@50 sobre LangMem

Recuperação de evidências LoCoMo

Execução pública completa. Os scores mostram se a evidência necessária aparece nas memórias recuperadas.

+8,21pp acima do 2º melhor R@50N=1,536
SistemaMRRR@1R@50R@200
Engram0.534540.63%92.19%97.66%
LangMem / LangGraph0.400228.32%83.98%94.53%
Mem0 OSS0.399928.32%83.92%94.27%
AgentMemory0.427033.20%79.10%84.96%
BM250.467634.57%78.19%85.74%

Avaliação de resposta LoCoMo

Diagnóstico revisado por Codex/self-review nas mesmas 98 tarefas. Mede se a resposta gerada a partir do contexto recuperado está correta.

N=98
SistemaResposta top-50Resposta top-200vs modelo base
Engram66.33%59.18%+56.13pp
Session-file BM2561.22%53.06%+51.02pp
Mem0 OSS55.10%57.14%+44.90pp
BM2548.98%44.90%+38.78pp
LangMem / LangGraph46.94%52.04%+36.74pp
No memory10.20%9.18%baseline
?

Como ler R@200 e Top-200

A recuperação de evidências é cumulativa: R@200 inclui o que R@50 encontrou e mais, então não deveria ser menor. Precisão de resposta é diferente. Mais contexto também pode trazer ruído ou memórias conflitantes; Top-50 pode responder de forma mais limpa, enquanto Top-200 testa se o empacotamento continua útil com mais evidência.

Suporte e feedback

Ajude-nos a melhorar o Engram

Se o setup está confuso, uma ferramenta age estranho ou um limite de preço parece errado, escreva aqui. A mensagem chega direto até nós.

Suporte e feedback

O que devemos melhorar?

Bugs, passos de setup confusos, dúvidas de preço e ideias de produto chegam direto ao time Engram.

Faltam 10 caracteres0/10