Herkese açık ölçüm

Gerçek bellek görevlerinde iki ayrı ölçüm

Engramı iki şekilde ölçüyoruz: önce doğru kanıtı buluyor mu, sonra model bu bağlamdan doğru cevabı üretebiliyor mu.

Kanıt bulma ve cevap doğruluğunu ayrı ayrı gösteriyoruz. İkisi de herkese açık LoCoMo veri setinde koşuyor; bellek döngüsünün farklı yerlerini ölçüyor.

1,536
puanlanmış kanıt bulma sorusu
92.19%
Engram R@50
66.33%
top-50 bağlamdan cevap doğruluğu
+8.21pp
LangMem karşısında R@50 farkı

LoCoMo kanıt bulma

Tam ve herkese açık koşu. Skorlar, gerekli kaynak kanıtın getirilen bellekler içinde yer alıp almadığını gösterir.

R@50’de ikinciye +8.21 puan farkN=1,536
SistemMRRR@1R@50R@200
Engram0.534540.63%92.19%97.66%
LangMem / LangGraph0.400228.32%83.98%94.53%
Mem0 OSS0.399928.32%83.92%94.27%
AgentMemory0.427033.20%79.10%84.96%
BM250.467634.57%78.19%85.74%

LoCoMo cevap doğruluğu

Aynı 98 görev üzerinde Codex/self-review ile değerlendirildi. Skorlar, getirilen bağlamdan üretilen cevabın doğru olup olmadığını gösterir.

N=98
SistemTop-50 cevapTop-200 cevapTemel modele göre
Engram66.33%59.18%+56.13pp
Session-file BM2561.22%53.06%+51.02pp
Mem0 OSS55.10%57.14%+44.90pp
BM2548.98%44.90%+38.78pp
LangMem / LangGraph46.94%52.04%+36.74pp
No memory10.20%9.18%baseline
?

R@200 ve Top-200 nasıl okunmalı?

Kanıt bulma kümülatiftir: R@200, R@50’nin bulduklarının üstüne daha fazla kanıt ekler; bu yüzden daha düşük olmamalıdır. Cevap doğruluğu farklıdır. Daha fazla bağlam doğru kanıtla birlikte gürültü veya çelişkili kayıt da getirebilir; Top-50 bazen daha temiz cevap verir, Top-200 ise çok kanıt gelince paketlemenin hâlâ işe yarayıp yaramadığını ölçer.

Destek ve geri bildirim

Engram’ı birlikte geliştirelim

Kurulum kafa karıştırıyorsa, bir araç garip davranıyorsa veya fiyat limiti yanlış görünüyorsa buradan yazın. Mesaj doğrudan bize gelir.

Geri bildirim

Neyi geliştirelim?

Hatalar, kafa karıştıran kurulum adımları, fiyat soruları ve ürün fikirleri doğrudan Engram ekibine gelir.

10 karakter daha gerekli0/10