Benchmark público

Medido con tareas reales de memoria en dos pruebas

Medimos Engram de dos formas: si recupera la evidencia correcta y si un LLM puede responder bien usando ese contexto.

Separamos recuperación de evidencia y precisión de respuesta. Ambas pruebas usan LoCoMo público, pero miden partes distintas del ciclo de memoria.

1,536
preguntas puntuadas de recuperación
92.19%
Engram R@50
66.33%
precisión con contexto top-50
+8.21pp
ventaja R@50 sobre LangMem

Recuperación de evidencia LoCoMo

Ejecución pública completa. Las puntuaciones indican si la evidencia necesaria aparece entre las memorias recuperadas.

+8.21pp sobre el segundo mejor R@50N=1,536
SistemaMRRR@1R@50R@200
Engram0.534540.63%92.19%97.66%
LangMem / LangGraph0.400228.32%83.98%94.53%
Mem0 OSS0.399928.32%83.92%94.27%
AgentMemory0.427033.20%79.10%84.96%
BM250.467634.57%78.19%85.74%

Evaluación de respuesta LoCoMo

Diagnóstico revisado por Codex/self-review sobre las mismas 98 tareas. Mide si la respuesta generada desde el contexto recuperado es correcta.

N=98
SistemaRespuesta top-50Respuesta top-200vs modelo base
Engram66.33%59.18%+56.13pp
Session-file BM2561.22%53.06%+51.02pp
Mem0 OSS55.10%57.14%+44.90pp
BM2548.98%44.90%+38.78pp
LangMem / LangGraph46.94%52.04%+36.74pp
No memory10.20%9.18%baseline
?

Cómo leer R@200 y Top-200

La recuperación de evidencia es acumulativa: R@200 incluye lo de R@50 y más, así que no debería ser menor. La precisión de respuesta es distinta. Más contexto también puede traer ruido o memorias contradictorias; Top-50 puede responder más limpio y Top-200 prueba si el empaquetado sigue siendo útil con más evidencia.

Soporte y feedback

Mejoremos Engram juntos

Si el setup confunde, una herramienta se comporta raro o un límite de precio no cuadra, escríbenos aquí. El mensaje llega directo a nosotros.

Comentarios

¿Qué mejoramos?

Bugs, pasos de setup confusos, dudas de precio e ideas de producto llegan directo al equipo de Engram.

Faltan 10 caracteres0/10