Herkese açık ölçüm
Gerçek bellek görevlerinde iki ayrı ölçüm
Engramı iki şekilde ölçüyoruz: önce doğru kanıtı buluyor mu, sonra model bu bağlamdan doğru cevabı üretebiliyor mu.
Kanıt bulma ve cevap doğruluğunu ayrı ayrı gösteriyoruz. İkisi de herkese açık LoCoMo veri setinde koşuyor; bellek döngüsünün farklı yerlerini ölçüyor.
LoCoMo kanıt bulma
Tam ve herkese açık koşu. Skorlar, gerekli kaynak kanıtın getirilen bellekler içinde yer alıp almadığını gösterir.
| Sistem | MRR | R@1 | R@50 | R@200 |
|---|---|---|---|---|
| Engram | 0.5427 | 40.95% | 93.29% | 97.59% |
| Mem0 OSS | 0.4314 | 31.25% | 85.16% | 94.79% |
| LangMem / LangGraph | 0.4006 | 28.39% | 83.98% | 94.53% |
| AgentMemory | 0.4627 | 35.68% | 83.33% | N/A |
| Session-file BM25 | 0.1858 | 9.11% | 81.90% | 95.05% |
| BM25 | 0.4676 | 36.39% | 78.19% | 85.74% |
LoCoMo cevap doğruluğu
Her satır, kanıtı bulunan 1.536 görevin tamamı ve aynı top-50 sınırıyla ölçüldü. Cevapları Codex üretti; ayrı ve kör bir hakem puanladı. Bu, Engram tarafından yürütülen bir ölçümdür; resmi LoCoMo sıralaması değildir.
| Sistem | Doğru / N | Top-50 cevap |
|---|---|---|
| Engram | 1,377 / 1,536 | 89.65% |
| Mem0 OSS | 1,294 / 1,536 | 84.24% |
| AgentMemory | 1,280 / 1,536 | 83.33% |
| LangMem / LangGraph | 1,279 / 1,536 | 83.27% |
| Session-file BM25 | 1,235 / 1,536 | 80.40% |
| BM25 | 1,227 / 1,536 | 79.88% |
İki tablo nasıl okunmalı?
Yayınlanan iki ölçüm de kanıtı bulunan 1.536 görevin tamamını kullanır. Kanıt bulma kaynak kimliklerini gerektirir; cevap doğruluğunda sıralamaya giren her sistem için aynı cevap ve hakem modelleri kullanılır. Aynı değerlendirme sözleşmesini karşılamayan sistemler sıralamaya karıştırılmaz, ayrı olarak belgelenir.
İki tablo nasıl okunmalı?