Benchmark público

Metodologia de benchmark do Engram

Veja os conjuntos públicos, métricas de recuperação, testes de resposta, referências, limitações e regras por trás dos resultados publicados.

Recuperação de evidências LoCoMo92.19%
Avaliação de resposta LoCoMo66.33%
Como Funciona
01

Recuperação de evidências LoCoMo

Execução pública completa. Os scores mostram se a evidência necessária aparece nas memórias recuperadas.

02

Avaliação de resposta LoCoMo

Diagnóstico revisado por Codex/self-review nas mesmas 98 tarefas. Mede se a resposta gerada a partir do contexto recuperado está correta.

03

Como ler R@200 e Top-200

A recuperação de evidências é cumulativa: R@200 inclui o que R@50 encontrou e mais, então não deveria ser menor. Precisão de resposta é diferente. Mais contexto também pode trazer ruído ou memórias conflitantes; Top-50 pode responder de forma mais limpa, enquanto Top-200 testa se o empacotamento continua útil com mais evidência.

1,536

perguntas pontuadas de recuperação

92.19%

Engram R@50

66.33%

precisão com contexto top-50

Mantemos recuperação de evidência e precisão da resposta separadas. Ambas usam o LoCoMo público, mas medem partes diferentes do ciclo de memória.

LoCoMo ↗

Medimos o Engram de duas formas: se ele recupera a evidência certa e se um LLM responde corretamente com esse contexto.

Mantemos recuperação de evidência e precisão da resposta separadas. Ambas usam o LoCoMo público, mas medem partes diferentes do ciclo de memória.

Suporte e feedback

Ajude-nos a melhorar o Engram

Se o setup está confuso, uma ferramenta age estranho ou um limite de preço parece errado, escreva aqui. A mensagem chega direto até nós.

Suporte e feedback

O que devemos melhorar?

Bugs, passos de setup confusos, dúvidas de preço e ideias de produto chegam direto ao time Engram.

Faltam 10 caracteres0/10