Benchmark public

Méthodologie des benchmarks Engram

Consultez les jeux publics, métriques de récupération, contrôles de réponse, références, limites et règles derrière les résultats publiés.

Récupération de preuves LoCoMo92.19%
Évaluation des réponses LoCoMo66.33%
Comment ca marche
01

Récupération de preuves LoCoMo

Run public complet. Les scores indiquent si la preuve source nécessaire apparaît dans les mémoires récupérées.

02

Évaluation des réponses LoCoMo

Diagnostic relu par Codex/self-review sur les mêmes 98 tâches. Mesure si la réponse générée depuis le contexte récupéré est correcte.

03

Comment lire R@200 et Top-200

La récupération de preuves est cumulative : R@200 inclut ce que R@50 trouve, plus davantage, donc il ne devrait pas être plus bas. La précision de réponse est différente. Plus de contexte peut ajouter du bruit ou des mémoires contradictoires; Top-50 peut répondre plus proprement, tandis que Top-200 teste si le packaging reste utile avec plus de preuves.

1,536

questions notées en récupération

92.19%

Engram R@50

66.33%

justesse avec contexte top-50

Nous séparons la récupération de preuves et la justesse de réponse. Les deux utilisent LoCoMo public, mais mesurent deux étapes différentes.

LoCoMo ↗

Nous mesurons Engram de deux façons : retrouve-t-il la bonne preuve, puis le modèle répond-il correctement avec ce contexte ?

Nous séparons la récupération de preuves et la justesse de réponse. Les deux utilisent LoCoMo public, mais mesurent deux étapes différentes.

Support et feedback

Aidez-nous à améliorer Engram

Si le setup est confus, si un outil se comporte bizarrement ou si une limite de prix semble incorrecte, écrivez-nous ici. Le message arrive directement chez nous.

Support et feedback

Que devons-nous améliorer ?

Bugs, étapes de setup confuses, questions de prix et idées produit arrivent directement à l’équipe Engram.

Encore 10 caractères0/10