Benchmark ya wazi

Mbinu ya vipimo vya Engram

Tazama data za wazi, vipimo vya urejeshaji, ukaguzi wa majibu, viwango vya msingi, mipaka na kanuni za madai nyuma ya matokeo yaliyochapishwa.

Utafutaji wa ushahidi wa LoCoMo92.19%
Ukaguzi wa majibu wa LoCoMo66.33%
Inavyofanya Kazi
01

Utafutaji wa ushahidi wa LoCoMo

Run kamili ya wazi. Scores zinaonyesha kama source evidence inayohitajika ipo ndani ya memories zilizorejeshwa.

02

Ukaguzi wa majibu wa LoCoMo

Uchunguzi wa Codex/self-review kwenye kazi zilezile 98. Hupima kama jibu lililotengenezwa kutoka context iliyorejeshwa ni sahihi.

03

Jinsi ya kusoma R@200 na Top-200

Evidence retrieval ni cumulative: R@200 inaweza kujumuisha yote ya R@50 pamoja na zaidi, kwa hiyo haipaswi kuwa chini. Answer accuracy ni tofauti. Context nyingi inaweza kuongeza noise au memories zinazopingana; Top-50 wakati mwingine hujibu kwa usafi zaidi, huku Top-200 ikipima kama packaging bado inasaidia evidence inapoongezeka.

1,536

maswali yaliyopimwa ya evidence retrieval

92.19%

Engram R@50

66.33%

usahihi wa jibu kutoka top-50 context

Tunatenganisha evidence retrieval na usahihi wa jibu. Zote zinatumia LoCoMo ya wazi, lakini hupima sehemu tofauti za memory loop.

LoCoMo ↗

Tunapima Engram kwa njia mbili: kama inapata evidence sahihi, na kama LLM inaweza kujibu kwa usahihi kutoka kwenye context hiyo.

Tunatenganisha evidence retrieval na usahihi wa jibu. Zote zinatumia LoCoMo ya wazi, lakini hupima sehemu tofauti za memory loop.

Msaada na maoni

Tusaidie kuboresha Engram

Kama setup inachanganya, tool inafanya ajabu, au pricing limit inaonekana si sahihi, tuma hapa. Message inafika moja kwa moja kwetu.

Msaada na maoni

Tuboreshaje?

Bugs, setup steps zinazochanganya, pricing questions, na product ideas zinaenda moja kwa moja kwa Engram team.

Herufi 10 zaidi zinahitajika0/10