Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az emberek az AI-modellek eltérő dizájnjait választották

2026. október 8.Forrás: HumanSignal (Label Studio)
Az emberek az AI-modellek eltérő dizájnjait választották
Kép: HumanSignal (Label Studio)

A gpt-6-astra nyerte a HumanSignal tíz AI-modellt összevető dizájntesztjét, de az eredmények szerint az egyes feladatokhoz választott modell fontosabb lehet az összesített rangsornál. A résztvevők 4500 vak szavazata alapján hét modell legalább egy briefben első helyen végzett.

A lényeg röviden
  • A gpt-6-astra 64,3 százalékos győzelmi aránnyal első lett.
  • A tesztben 4500 vak szavazat érkezett 29 értékelőtől.
  • Hét modell legalább egy briefben első helyen végzett.
  • A HumanSignal szerint az adott brief fontosabb lehet az összesített rangsornál.
  • Az eredmények interaktív dashboardon és letölthető adatokban is elérhetők.

Tíz modell, 4500 vak szavazat

A HumanSignal október 8-án közzétett vizsgálatában 10 modell 10 tervezési briefet kapott. A modellek nem használhattak referenciákat, keretrendszereket vagy internetes keresést, így a kutatás készítői a modellek saját tervezési preferenciáit akarták összehasonlítani.

A vállalat a terveket vak, kiegyensúlyozott páros összevetésben tesztelte a Label Studio rendszerében. Minden modell minden másik modellel találkozott minden brief esetében, ami 450 páros összehasonlítást eredményezett. Egy összevetésre 10 szavazat érkezett, összesen 4500 voks 29 értékelőtől.

Az értékelők két weboldalt láttak egymás mellett, a modellek nevét viszont nem ismerték. Azt kellett kiválasztaniuk, melyik változat tetszik nekik esztétikailag jobban, vagy döntetlenre szavazhattak.

A gpt-6-astra végzett az élen

A HumanSignal által számított győzelmi arány alapján a gpt-6-astra 64,3 százalékkal lett első. A második helyen a grok-4.6 végzett 62,7 százalékkal, a harmadik a muse-spark-1.3 lett 60,3 százalékkal.

  • 4. hely: deepseek-v4-pro, 56,2 százalék
  • 5. hely: kimi-k3, 53,3 százalék
  • 6. hely: glm-5.3, 53,2 százalék
  • 7. hely: claude-sonnet-5, 49,1 százalék
  • 8. hely: qwen3.8-2.4t, 48,9 százalék
  • 9. hely: gemini-3.8-flash, 32,8 százalék
  • 10. hely: seed-2.0-code, 19,1 százalék

A készítők a páros eredményeket Bradley-Terry-modellel is elemezték. Ez a módszer a modellek rejtett erősségét becsüli a győzelmek alapján. A HumanSignal szerint ez ugyanazt az elsőtől tizedikig tartó sorrendet adta, mint a győzelmi arány.

Két párosnál gyakorlatilag döntetlen született. A kimi-k3 és a glm-5.3 között 0,1 százalékpont, a claude-sonnet-5 és a qwen3.8-2.4t között 0,2 százalékpont volt a különbség.

A konkrét feladat többet számíthat az összesített rangsornál

A HumanSignal szerint az összesített lista félrevezető lehet, ha valaki egy konkrét típusú tervezési munkához keres modellt. Hét különböző modell végzett legalább egy briefben az első helyen.

A gpt-6-astra összesítésben első lett, és két briefet meg is nyert. Ugyanakkor az orvosi kutatási konferenciához készült briefben csak a nyolcadik helyen végzett. A top háromon kívüli modellek közül a glm-5.3 érte el a legjobb átlagos briefhelyezést, 4,5-ös értékkel, mégis hatodik lett összesítésben. A tudományos kiadvány briefjében viszont utolsóként zárt, 24 százalékos győzelmi aránnyal.

A claude-sonnet-5 minden briefben a negyedik és a kilencedik hely között végzett, vagyis ez volt a legkiegyensúlyozottabb modell. Az összesített rangsorban mégis csak a hetedik helyet szerezte meg. A vállalat következtetése szerint a felhasználóknak érdemes inkább a saját munkájukhoz hasonló briefek eredményeit vizsgálniuk.

Interaktív felületen vizsgálhatók a döntések

A HumanSignal dashboardja briefenként mutatja a tíz elkészült weboldalt, a választások gyakorisága szerinti rangsorral. A tervek mellett megtekinthető az adott modell költsége, generálási ideje, saját tervezési iránya és az emberi értékelés, valamint megnyitható az élő oldal is.

A felület azt is megmutatja, milyen döntéseket hoztak a modellek a kódírás előtt. Összevethetők a megnevezett betűtípusok, a színpaletták és a választások indoklásai. A 100 kreatív irányból 53-ban szerepelt az Inter, 34-ben az IBM Plex Mono, 25-ben pedig a Fraunces.

Az eredmények JSON formátumban tölthetők le, a rangsorok és a pilot módszertana pedig CSV-ként is elérhető. A HumanSignal a következő hetekben további elemzéseket ígér a dashboard adatai alapján.

Kövesd az AI Hírek oldalát a FacebookonA legfontosabb MI-hírek magyarul, rögtön a megjelenés után a hírfolyamodban.Követem

Kapcsolódó hírek

A HumanSignal szerint az AI-modelleknek közös „házi stílusuk” van
Kutatás2026. október 6.

A HumanSignal szerint az AI-modelleknek közös „házi stílusuk” van

A különböző AI-laborok modelljei meglepően hasonló vizuális döntéseket hoztak, amikor önállóan kellett weboldalakat tervezniük. A HumanSignal 10 modellt, 10 kreatív…

A Label Studio közvetlenül a DICOM-fájlok annotálását teszi lehetővé
Cégek és üzlet2026. szeptember 30.

A Label Studio közvetlenül a DICOM-fájlok annotálását teszi lehetővé

A HumanSignal olyan DICOM-annotációs felületet mutatott be, amely a fájlok PNG-képsorozattá alakítása nélkül jeleníti meg és szerkeszti az orvosi képalkotási adatokat. A…

A videómodellek még látványosan elbuknak a fizika alapjain
Kutatás2026. szeptember 23.

A videómodellek még látványosan elbuknak a fizika alapjain

A modern videómodellek meggyőző képkockákat készítenek, de ez nem jelenti azt, hogy következetesen értik a háromdimenziós világot. A HumanSignal kísérletei szerint a…