350 millió dollárt vont be az AI-adatokra építő Snorkel AI

A Snorkel AI 350 millió dolláros Series E finanszírozást vont be 3,5 milliárd dolláros értékelés mellett. A vállalat kutatási laboratóriumot építene az AI-rendszerek fejlesztéséhez szükséges adatok előállítására.
- A Snorkel AI 350 millió dolláros Series E finanszírozást vont be.
- A vállalat értékelése 3,5 milliárd dollár lett.
- A cég több mint 18-szoros növekedést jelentett az adat mint szolgáltatás ajánlat indulása óta.
- A Snorkel emberi szakértőkkel együttműködő AI-modellekkel fejlesztené a frontier adatokat.
- A vállalat szerint kódolási feladatoknál a minőség-ellenőrzés több mint 50 százalékkal gyorsult.
3,5 milliárd dollárra értékelték a vállalatot
Az új befektetési kört az Insight és az S32 vezette. A finanszírozásban részt vett a Third Point, a March, a Blumberg, az Allegis, a Standard VC és a Frontline, valamint a Snorkel meglévő befektetői közül az Addition, a Lightspeed, a Greylock, a GV, a P7, a Wells Fargo, a Walden Catalyst Ventures és a Factory.
A szeptember 22-én közzétett bejelentés szerint a Snorkel közel egy éve indította el adat mint szolgáltatásra épülő ajánlatát. A vállalat állítása szerint azóta több mint 18-szoros növekedést ért el, és a héten átlépte a 375 millió dolláros évesített bevételi ütemet.
A Snorkel közlése szerint ügyfelei között vezető frontier laborok, felhőszolgáltatók, úgynevezett neolabok, vertikális AI-vállalatok, nagyvállalatok és amerikai kormányzati ügynökségek is vannak. A cég szerint ezek a szervezetek az adatot a biztonságos és hatékony AI egyik legfontosabb összetevőjének tekintik.
A Data 2.0 már kutatási és technológiai feladat
A Snorkel egy évtizede, Stanfordon indult kutatási projektként. Alapfeltevése szerint az AI fejlődése egyre inkább adatközpontúvá válik, ezért az adatfejlesztést valódi kutatási és technológiai problémaként kell kezelni, nem pusztán munkaerő- és tömeges adatgyűjtési feladatként.
A vállalat ezt a változást Data 2.0-nak nevezi. A Data 1.0 szakaszban a fejlődést elsősorban nagy mennyiségű, egyszerűbb adat biztosítja, amelynek előállítása főként szervezési és logisztikai kérdés. A fejlettebb rendszereknél viszont a továbblépéshez rendkívül összetett, pontosan célzott és jó minőségű adatokra van szükség.
A Snorkel példaként a kódolást említi. Néhány éve a nyelvi modellek még főként kódkiegészítésre voltak képesek, ezért nagy mennyiségű nyers kódolási adat és egyszerű feladat kellett a tanításukhoz. A vállalat szerint ma már sok kódolási területen emberfeletti képességekhez közelítenek a modellek, így a fejlesztéshez olyan adatok és megerősítéses tanulási környezetek kellenek, amelyek egy vezető fejlesztő számára is napokig vagy hetekig tartó problémákat modelleznek.
Ezeknek a feladatoknak összetett célokat és jutalmazási jeleket kell kezelniük, célozniuk kell a modellek jellegzetes hibáit, és ellenállónak kell lenniük a kijátszási vagy csalási kísérletekkel szemben. A Snorkel szerint hasonló igények jelennek meg a jog, a pénzügy és a biológia területén is.
Az emberi szakértelem marad az adatfejlesztés középpontjában
A Snorkel szerint a frontier adatok előállítása már nem oldható meg pusztán az emberi munkaórák és szakértők számának növelésével. A vállalat olyan megközelítést követ, amelyben az emberi szakértelem és a mesterséges intelligencia gyorsítása együtt vesz részt az adatfejlesztésben.
A cég érvelése szerint a teljesen szintetikus adatok természetüknél fogva erősen kapcsolódhatnak ahhoz, amit a modell már ismer, és kevésbé ahhoz, amit még meg kell tanulnia. Emiatt az emberi részvétellel készített adatok továbbra is fontosak lehetnek. Az emberi felügyeletet az összehangolás és a biztonság szempontjából is szükségesnek tartják, mivel az adatokkal mérik az AI teljesítményét, és azok segítségével igazítják az emberi értékekhez.
A Snorkel belső Agentic Data Platformja olyan speciális AI-modelleket és ügynököket használ, amelyek szakértői vázlatokból és korlátozásokból adatokat, illetve környezeteket bővíthetnek ki, a munkát a modellhibák felé irányíthatják, visszajelzést adhatnak, valamint minőség-ellenőrzést végezhetnek. A cél az, hogy az emberek akkor is az adatértékelés és -fejlesztés középpontjában maradjanak, amikor a modellek képességei tovább nőnek.
Önmagát erősítő adatfejlesztési ciklust építenének
A vállalat egyik fő célja az úgynevezett RSI-motor létrehozása az adatokhoz. A rövidítés a rekurzív önfejlesztésre utaló recursive self-improvement kifejezésből származik. A rendszerben speciális AI-modellek javítják és gyorsítják az emberi szakértők munkáját, a nagy léptékű emberi felügyelet pedig folyamatosan méri és fejleszti ezeket a modelleket.
A Snorkel közlése szerint egyetlen feladattípushoz akár több száz speciális ügynököt is alkalmazhatnak. Kódolási ügynökök környezetének és adatainak készítésekor például több száz ügynök végez minőség-ellenőrzést az emberi szakértői felülvizsgálat mellett. A vállalat szerint ez jelenleg több mint 50 százalékkal gyorsítja a minőség-ellenőrzést, és több mint 15 százalékkal javítja a felülvizsgálat pontosságát.
A most bevont tőkével a Snorkel az adatfejlesztés nyitottabb támogatását, a méréshez és értékeléshez használható nyílt adatok bővítését, valamint az általános és specializált intelligenciák sokszínű ökoszisztémáját kívánja erősíteni. A vállalat szerint a következő AI-fejlesztési szakaszokat az adatok alakítják majd, ezért azok előállításának emberközpontúnak, AI által gyorsítottnak, nyitottnak, sokszínűnek és biztonságosnak kell lennie.
Snorkel AI: Data 2.0 and the research era of AI data


