Utafutaji wa ushahidi wa LoCoMo
Run kamili ya wazi. Scores zinaonyesha kama source evidence inayohitajika ipo ndani ya memories zilizorejeshwa.
Benchmark ya wazi
Tazama data za wazi, vipimo vya urejeshaji, ukaguzi wa majibu, viwango vya msingi, mipaka na kanuni za madai nyuma ya matokeo yaliyochapishwa.
Run kamili ya wazi. Scores zinaonyesha kama source evidence inayohitajika ipo ndani ya memories zilizorejeshwa.
Uchunguzi wa Codex/self-review kwenye kazi zilezile 98. Hupima kama jibu lililotengenezwa kutoka context iliyorejeshwa ni sahihi.
Evidence retrieval ni cumulative: R@200 inaweza kujumuisha yote ya R@50 pamoja na zaidi, kwa hiyo haipaswi kuwa chini. Answer accuracy ni tofauti. Context nyingi inaweza kuongeza noise au memories zinazopingana; Top-50 wakati mwingine hujibu kwa usafi zaidi, huku Top-200 ikipima kama packaging bado inasaidia evidence inapoongezeka.
maswali yaliyopimwa ya evidence retrieval
Engram R@50
usahihi wa jibu kutoka top-50 context
Tunatenganisha evidence retrieval na usahihi wa jibu. Zote zinatumia LoCoMo ya wazi, lakini hupima sehemu tofauti za memory loop.
LoCoMo ↗Tunatenganisha evidence retrieval na usahihi wa jibu. Zote zinatumia LoCoMo ya wazi, lakini hupima sehemu tofauti za memory loop.
Msaada na maoni
Kama setup inachanganya, tool inafanya ajabu, au pricing limit inaonekana si sahihi, tuma hapa. Message inafika moja kwa moja kwetu.