Herkese açık ölçüm
Gerçek bellek görevlerinde iki ayrı ölçüm
Engramı iki şekilde ölçüyoruz: önce doğru kanıtı buluyor mu, sonra model bu bağlamdan doğru cevabı üretebiliyor mu.
Kanıt bulma ve cevap doğruluğunu ayrı ayrı gösteriyoruz. İkisi de herkese açık LoCoMo veri setinde koşuyor; bellek döngüsünün farklı yerlerini ölçüyor.
LoCoMo kanıt bulma
Tam ve herkese açık koşu. Skorlar, gerekli kaynak kanıtın getirilen bellekler içinde yer alıp almadığını gösterir.
| Sistem | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5345 | 40.63% | 92.19% | 97.66% |
| LangMem / LangGraph | 0.4002 | 28.32% | 83.98% | 94.53% |
| Mem0 OSS | 0.3999 | 28.32% | 83.92% | 94.27% |
| AgentMemory | 0.4270 | 33.20% | 79.10% | 84.96% |
| BM25 | 0.4676 | 34.57% | 78.19% | 85.74% |
LoCoMo cevap doğruluğu
Aynı 98 görev üzerinde Codex/self-review ile değerlendirildi. Skorlar, getirilen bağlamdan üretilen cevabın doğru olup olmadığını gösterir.
| Sistem | Top-50 cevap | Top-200 cevap | Temel modele göre |
|---|---|---|---|
| Engram | 66.33% | 59.18% | +56.13pp |
| Session-file BM25 | 61.22% | 53.06% | +51.02pp |
| Mem0 OSS | 55.10% | 57.14% | +44.90pp |
| BM25 | 48.98% | 44.90% | +38.78pp |
| LangMem / LangGraph | 46.94% | 52.04% | +36.74pp |
| No memory | 10.20% | 9.18% | baseline |
R@200 ve Top-200 nasıl okunmalı?
Kanıt bulma kümülatiftir: R@200, R@50’nin bulduklarının üstüne daha fazla kanıt ekler; bu yüzden daha düşük olmamalıdır. Cevap doğruluğu farklıdır. Daha fazla bağlam doğru kanıtla birlikte gürültü veya çelişkili kayıt da getirebilir; Top-50 bazen daha temiz cevap verir, Top-200 ise çok kanıt gelince paketlemenin hâlâ işe yarayıp yaramadığını ölçer.