A Microsoft‑kutatók azt állítják, hogy az AI‑modellek még nem képesek összetett feladatokat megoldani.

A Microsoft‑kutatók azt állítják, hogy az AI‑modellek még nem képesek összetett feladatokat megoldani.

22 hardware

Microsoft kutatói feltárták a modern nagy nyelvi modellek (LLM) korlátait összetett többszörös feladatok végrehajtásakor

A Microsoft Research kísérletei során kiderült, hogy még a legfejlettebb AI‑modellek is komoly hibákat követnek el, amikor hosszú és több lépcsős műveleteket kell végezniük. A tesztelt rendszerek közé tartozik a Gemini 3.1 Pro, a Claude 4.6 Opus és az GPT 5.4 – átlagosan mindegyik körülbelül 25 % dokumentumkészletet veszít el önálló feldolgozás után.

Mi volt pontosan tesztelve
* DELEGATE‑52 benchmark

Felipe Labana, Tobias Schnabel és Jennifer Neville csapata hozta létre. A modell a 52 szakmai terület munkafolyamatait szimulálja: a programozástól és zenei jelölésig a kristályográfiáig.

* Értékelési kritérium

A modelleket arra értékelték, hogy mennyire tartják meg a dokumentum integritását 20 feldolgozási kör után. Az „elkészültségi” küszöböt 98 %-ra állították – ha az eredmény alacsonyabb volt, a feladat sikertelennek számította.

Főbb következtetések
Terület Legjobb eredmények Programozás Legerősebb mutatók Természetes nyelv Legrugalmasabb modellek
* Minőségcsökkenés

Több mint 80 % dokumentumkombinációnál a minőség 80 %-ra vagy alacsonyabbra csökkent. A legjobb modell (Gemini 3.1 Pro) csak 11-ből 52 területen felelt meg az elkészültségi kritériumnak.

* Hoppó hibák

Az elvesztések nem folyamatosan, hanem „hoppóként” történtek: egyetlen interakciós körben a modell akár 10–30 % pontosságot is elveszthetett. A fejlettebb modellek (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) igyekeztek elkerülni a kis hibákat, későbbi szakaszokra halasztva azok feldolgozását és csökkentve az interakciók számát.

* Ügynöki irányítás

Ügynöki módban eszközök használata esetén a teljesítmény nem javult: a kör végére a minőség körülbelül 6 % -kal csökkent.

Mit jelent ez a felhasználók számára
A tudósok hangsúlyozzák, hogy a felhasználóknak továbbra is alaposan ellenőrizniük kell az AI‑rendszerek működését, amikor hatásköröket delegálnak. A jelenlegi modellek csak szűk területeken képesek önállóan dolgozni.

Azonban a benchmark szerzői megjegyzik, hogy jelentős előrelépés történt: az OpenAI modellcsalád 16 hónap alatt javította teljesítményét 14,7 % -ról 71,5 %-ra. Ez megerősíti, hogy az LLM-ek tovább fejlődnek, de még mindig korlátozottak a komplex többszörös feladatokban.

Hozzászólások (0)

Oszd meg a véleményed — kérjük, légy udvarias és maradj a témánál.

Még nincsenek hozzászólások. Írj hozzászólást és oszd meg a véleményed!

Hozzászóláshoz kérjük, jelentkezz be.

Jelentkezz be a hozzászóláshoz