A Microsoft‑kutatók azt állítják, hogy az AI‑modellek még nem képesek összetett feladatokat megoldani.
Microsoft kutatói feltárták a modern nagy nyelvi modellek (LLM) korlátait összetett többszörös feladatok végrehajtásakor
A Microsoft Research kísérletei során kiderült, hogy még a legfejlettebb AI‑modellek is komoly hibákat követnek el, amikor hosszú és több lépcsős műveleteket kell végezniük. A tesztelt rendszerek közé tartozik a Gemini 3.1 Pro, a Claude 4.6 Opus és az GPT 5.4 – átlagosan mindegyik körülbelül 25 % dokumentumkészletet veszít el önálló feldolgozás után.
Mi volt pontosan tesztelve
* DELEGATE‑52 benchmark
Felipe Labana, Tobias Schnabel és Jennifer Neville csapata hozta létre. A modell a 52 szakmai terület munkafolyamatait szimulálja: a programozástól és zenei jelölésig a kristályográfiáig.
* Értékelési kritérium
A modelleket arra értékelték, hogy mennyire tartják meg a dokumentum integritását 20 feldolgozási kör után. Az „elkészültségi” küszöböt 98 %-ra állították – ha az eredmény alacsonyabb volt, a feladat sikertelennek számította.
Főbb következtetések
Terület Legjobb eredmények Programozás Legerősebb mutatók Természetes nyelv Legrugalmasabb modellek
* Minőségcsökkenés
Több mint 80 % dokumentumkombinációnál a minőség 80 %-ra vagy alacsonyabbra csökkent. A legjobb modell (Gemini 3.1 Pro) csak 11-ből 52 területen felelt meg az elkészültségi kritériumnak.
* Hoppó hibák
Az elvesztések nem folyamatosan, hanem „hoppóként” történtek: egyetlen interakciós körben a modell akár 10–30 % pontosságot is elveszthetett. A fejlettebb modellek (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) igyekeztek elkerülni a kis hibákat, későbbi szakaszokra halasztva azok feldolgozását és csökkentve az interakciók számát.
* Ügynöki irányítás
Ügynöki módban eszközök használata esetén a teljesítmény nem javult: a kör végére a minőség körülbelül 6 % -kal csökkent.
Mit jelent ez a felhasználók számára
A tudósok hangsúlyozzák, hogy a felhasználóknak továbbra is alaposan ellenőrizniük kell az AI‑rendszerek működését, amikor hatásköröket delegálnak. A jelenlegi modellek csak szűk területeken képesek önállóan dolgozni.
Azonban a benchmark szerzői megjegyzik, hogy jelentős előrelépés történt: az OpenAI modellcsalád 16 hónap alatt javította teljesítményét 14,7 % -ról 71,5 %-ra. Ez megerősíti, hogy az LLM-ek tovább fejlődnek, de még mindig korlátozottak a komplex többszörös feladatokban.
Hozzászólások (0)
Oszd meg a véleményed — kérjük, légy udvarias és maradj a témánál.
Jelentkezz be a hozzászóláshoz