Benchmark público

Metodología de evaluación de Engram

Consulta los conjuntos públicos, métricas de recuperación, pruebas de respuesta, referencias, límites y reglas de publicación detrás de los resultados de Engram.

Recuperación de evidencia LoCoMo92.19%
Evaluación de respuesta LoCoMo66.33%
Cómo funciona
01

Recuperación de evidencia LoCoMo

Ejecución pública completa. Las puntuaciones indican si la evidencia necesaria aparece entre las memorias recuperadas.

02

Evaluación de respuesta LoCoMo

Diagnóstico revisado por Codex/self-review sobre las mismas 98 tareas. Mide si la respuesta generada desde el contexto recuperado es correcta.

03

Cómo leer R@200 y Top-200

La recuperación de evidencia es acumulativa: R@200 incluye lo de R@50 y más, así que no debería ser menor. La precisión de respuesta es distinta. Más contexto también puede traer ruido o memorias contradictorias; Top-50 puede responder más limpio y Top-200 prueba si el empaquetado sigue siendo útil con más evidencia.

1,536

preguntas puntuadas de recuperación

92.19%

Engram R@50

66.33%

precisión con contexto top-50

Separamos recuperación de evidencia y precisión de respuesta. Ambas pruebas usan LoCoMo público, pero miden partes distintas del ciclo de memoria.

LoCoMo ↗

Medimos Engram de dos formas: si recupera la evidencia correcta y si un LLM puede responder bien usando ese contexto.

Separamos recuperación de evidencia y precisión de respuesta. Ambas pruebas usan LoCoMo público, pero miden partes distintas del ciclo de memoria.

Soporte y feedback

Mejoremos Engram juntos

Si el setup confunde, una herramienta se comporta raro o un límite de precio no cuadra, escríbenos aquí. El mensaje llega directo a nosotros.

Comentarios

¿Qué mejoramos?

Bugs, pasos de setup confusos, dudas de precio e ideas de producto llegan directo al equipo de Engram.

Faltan 10 caracteres0/10