Mesterséges intelligencia, magyarul.
Az eredeti közleményekből.

Az Anthropic csökkentette Claude jellegzetes fordulatait, de nem tűntek el

2026. szeptember 29.Forrás: Arize AI
Az Anthropic csökkentette Claude jellegzetes fordulatait, de nem tűntek el
Kép: Arize AI

Az Opus 5.5 valóban szinte teljesen elhagyta a hosszú gondolatjeleket, és a Claude-ra jellemző stiláris fordulatok száma is csökkent. Az Arize AI vizsgálata szerint azonban az Anthropic állítása, miszerint „megjavították az írást”, túl erős.

A lényeg röviden
  • Az Opus 5.5 két gondolatjelet használt 57 ezer szóban.
  • A gondolatjelek gyakorisága 99,6 százalékkal csökkent.
  • A Claude-jellegű fordulatok sűrűsége 4,79-ről 2,38-ra esett ezer szónként.
  • Az Arize 20 rögzített brief alapján, négy kísérletben tesztelte a két modellt.
  • A vizsgálat szerint a probléma retorikai mintázatokból is áll, nem csak jellegzetes szavakból.

Az Arize mérhető próbával ellenőrizte az Anthropic állítását

Az Anthropic az Opus 5.5 bejelentésekor azt írta, hogy jelentősen javítottak a modell írásán és kommunikációján, az Opus 5-höz érkezett visszajelzések egyik leggyakoribb témáján. A vállalat szerint az új modell kisebb eséllyel használ szakzsargont vagy egyedi, nehezen megmagyarázható fordulatokat. Az Anthropic munkatársai ennél tömörebben is fogalmaztak: Sholto Douglas szerint „megjavítottuk az írást”, Tom Brown pedig azt írta, hogy „megjavítottuk a hanglejtést”.

Jim Bennett, az Arize munkatársa a claude-compare vizsgálattal ellenőrizte ezeket az állításokat az Arize AX rendszerében. Húsz rögzített kutatási összefoglalót használt, amelyek öt műfajt, véleménycikket, technikai magyarázatot, útmutató-bevezetőt, hírelemzést és termékbejelentést, valamint öt tématerületet fedtek le: a mesterséges intelligenciát, az utazást, a főzést, a játékokat és a könyveket.

A két modell azonos utasítást kapott, a gondolkodási erőfeszítés szintjét közepesre állították, majd mindkettővel két ismételt futtatást végeztek. Így négy kísérlet, 80 bejegyzés és körülbelül 110 ezer szó keletkezett.

A probléma több, mint néhány jellegzetes szó

Bennett először kézzel jelölte meg az Opus 5 40 kimenetében a Claude-ra jellemző fordulatokat. A 53 ezer szavas anyagban 153 jelölés született, 38 bejegyzésben. A gyakran emlegetett szavakból és kifejezésekből álló lista, például a „load-bearing”, a „delve” és a „crucially”, mindössze kilenc találatot azonosított.

A legtöbb kifogásolt rész inkább retorikai mintázat volt. Körülbelül 48 esetben a szöveg kijelentette, hogy valami fontos, ahelyett, hogy megmutatta volna, miért az. További csoportot alkottak az ellentétre épülő átkeretezések, az erősítő értékelések és az olyan felvezető mondatok, amelyek egy állítólagos felismerést ígérnek az olvasónak. Bennett ezért arra jutott, hogy nem pusztán szóhasználati, hanem szerkezeti és retorikai problémáról van szó.

Az értékeléshez olyan nyelvi bírót készített, amely a kifogásolható részleteket pontos idézetként és hat kategóriában jelöli meg. A gondolatjeleket külön, kódalapú számlálóval mérték. A bírót az OpenAI gpt-6-luna modellje adta, így Claude nem saját családját értékelte.

A gondolatjelek szinte eltűntek, a többi jelenség megfeleződött

Az Opus 5 kimenetében ezer szóra 12,9 gondolatjel jutott. Az Opus 5.5 a teljes, 57 ezer szavas kimenetében mindössze kettőt használt. A mérés szerint ez 0,05 gondolatjelet jelent ezer szóra, ami 99,6 százalékos visszaesés.

A Claude-jellegű fordulatok sűrűsége 4,79-ről 2,38-ra csökkent ezer szónként. Ez 50 százalékos javulás az Arize mérőszáma szerint, de nem jelenti a jelenség megszűnését. Az Opus 5.5 ráadásul körülbelül 8 százalékkal hosszabb szövegeket írt, ezért a vizsgálat a nyers darabszám helyett hosszra normalizált értékeket használt.

Az eredmények alapján az Opus 5.5 írása kevésbé használja a legfeltűnőbb Claude-jegyeket, különösen a gondolatjeleket. Az Arize következtetése szerint azonban a modell írása még nem lett teljesen mentes a kifogásolt retorikai fordulatoktól, ezért az Anthropic „megjavítottuk az írást” állítása csak részben igazolható.

Kapcsolódó hírek

Az Anthropic tényleg javított Claude stílusán, de nem tüntette el teljesen
Kutatás2026. szeptember 29.

Az Anthropic tényleg javított Claude stílusán, de nem tüntette el teljesen

Az Opus 5.5 valóban sokkal kevesebb em dash jelet és Claude-ra jellemző fordulatot használ, mint az Opus 5, de az Arize AI vizsgálata szerint a probléma nem tűnt el…

A Jev valószínűségei olyan hibákat is jeleznek, amelyeket az LLM-ek elrejtenek
Kutatás2026. szeptember 28.

A Jev valószínűségei olyan hibákat is jeleznek, amelyeket az LLM-ek elrejtenek

A Jev címkénkénti valószínűségei megbízhatóan jelezték, mikor tévedett az értékelésben, miközben az ismételten futtatott nyelvi modellek sok hibás döntésnél…

A Snorkel szerint az Opus 5.5 vezet a kódolási tesztben
Kutatás2026. szeptember 23.

A Snorkel szerint az Opus 5.5 vezet a kódolási tesztben

Az Opus 5.5 érte el a legmagasabb összesített sikerarányt a Snorkel AI szakértők által összeállított kódolási feladatsorán. A modell 68 százalékos eredményt ért el…