A Claude Mythos tesztekkel igazolták, hogy a sebezhetőségek felfedezésében vezető, azonban más hiányosságokat is mutat.

A Claude Mythos tesztekkel igazolták, hogy a sebezhetőségek felfedezésében vezető, azonban más hiányosságokat is mutat.

33 hardware

A XBOW független értékelést végezett az Anthropic Mythos Preview AI-modelljéről. Az eredmények azt mutatták, hogy a modell felülmúlja a meglévő hasonlókat a forráskód sebezhetőségeinek keresésében, valamint a natív kóddal és a visszafejtéssel való munkában, de gyengeségei vannak az izolált kód elemzésében és a talált exploitok gyakorlati alkalmazhatóságának megerősítésében. A modell költsége kérdéses: a Mythos drágább, mint az Opus, de korlátozott tokenköltség esetén néha jobb pontosságot mutat.

1. Mit vizsgált a XBOW
- Teszt mennyisége – egy sor független kísérlet a Mythos Preview-re.
- Forgatókönyvek – működő rendszerek auditálása forráskód hozzáféréssel, izolált kód elemzése, visszafejtés és grafikus felhasználói felülettel való interakció.

2. Kulcsfontosságú megállapítások
| Mutató | Mythos Preview | Ellentétes modellek |
|---|---|---|
| Sebezhetőségek felfedezése | Legjobb mutató a forráskódban és natív programozásban. | Kevésbé pontos, de néha megbízhatóbb konkrét esetek ellenőrzésekor. |
| Hamis riasztások szűrése | Többet távolít el „hamis” találatból, mint a elődeik. | Gyakran több hamis riasztást ad. |
| Izolált kód problémái | A modell rosszabb teljesítményt nyújt kontextus nélkül. | Néhány modell jobban dolgozik soronkénti elemzésben. |
| Exploitok megerősítése | Szöveges megközelítésre hajlamos, néha túlszámolja a gyakorlati értéket. | Kritikusanabb a valódi alkalmazhatóság tekintetében. |
| Visszafejtés és natív kód | Erőteljes eredmények; jól „érti” a program logikáját forráskód nélkül. | Kevésbé pontos ezekben a feladatokban. |
| UI interakció | Nem mindig pontosan találja meg az elemek koordinátáit, de sikeresen meghatározza a szükséges műveleteket a böngészőben. | Néhány modell pontosabb a pozicionálásban. |

3. Költség és hatékonyság
- Árazás – Az Anthropic azt állítja, hogy a Mythos öt-szorosára kerül az Opusnak.
- Gazdasági elemzés – A XBOW „olcsó” modellekkel végzett kísérleteket futtatta, több időt biztosítva számukra. Az eredmények szerint a Mythos Preview költségnormalizálás után nem tűnik spórolhatatlannak a magas pontosságú feladatokhoz.
- Benchmarkek – Fix tokenköltség mellett a Mythos 4,6-szor jobb a web sebezhetőségek keresésében, mint az Opus, de alulmarad a GPT5.5-höz képest.

4. Összegzés
A Mythos Preview kiemelkedő erőt mutat forráskód és natív programok auditálásában, valamint visszafejtési és webalkalmazások elemzési feladatokban. Azonban a modell néha alábecsüli a talált sebezhetőségek valódi alkalmazhatóságát, és gyengeségei vannak az izolált kód elemzésében. Korlátozott tokenforrások mellett a Mythos lehet hasznosabb, mint az Opus, de teljes költségvetés esetén a GPT5.5 továbbra is versenyképes.

A XBOW következtetése: A Mythos Preview megbízható eszköz a potenciális sebezhetőségek felismerésére forráskódban és összetett rendszerekben, de további ellenőrzést igényel a talált exploitok gyakorlati értékének megerősítéséhez.

Hozzászólások (0)

Oszd meg a véleményed — kérjük, légy udvarias és maradj a témánál.

Még nincsenek hozzászólások. Írj hozzászólást és oszd meg a véleményed!

Hozzászóláshoz kérjük, jelentkezz be.

Jelentkezz be a hozzászóláshoz