AI hírek 08.19.: biztonsági rések és az ügynöki AI terjedése

A mai hírek középpontjában az AI-rendszerek biztonsága állt. Kutatók több módszert is bemutattak a modellek, ügynökök és értékelési rendszerek gyenge pontjainak feltárására, miközben a vállalatok új üzleti és fejlesztői platformokkal bővítették az AI gyakorlati alkalmazását.
- A FAR.AI több GPT-4 és AI-biztonsági gyenge pontra hívta fel a figyelmet.
- Az AI-ügynökök több lépéses beszélgetésekkel könnyebben manipulálhatók.
- A Factory 100 millió dollárral épít AI-szoftverfejlesztési partnerhálózatot.
- Új vállalati ügynöki funkciókat jelentett be a Salesforce, a Cursor és a Vercel.
- A kutatások az AI-képek szerzőségének és az LLM-bírók megbízhatóságának korlátait vizsgálták.
Biztonsági rések és új védelmi megközelítések
A FAR.AI kutatói szerint több ponton megkerülhető a GPT-4 védelme. Három GPT-4 API-funkció vizsgálata során olyan módszereket találtak, amelyek káros kimenetekhez vagy alkalmazások eltérítéséhez vezethetnek. A kutatás szerint már kis finomhangolási adatkészletek is gyengíthetik a modell alapvető védelmi korlátait.
Az EPFL kutatói az AI-ügynökök több lépéses manipulációjára figyelmeztetnek. A támadók egymás után ártalmatlannak tűnő kérésekkel jelentősen nagyobb eséllyel vehetik rá az ügynököket káros feladatok végrehajtására. A FAR.AI közben a modellek belső állapotainak vizsgálatát ígéretesebb iránynak tartja a megtévesztés felismerésében.
Az Európai Bizottság AI Office-a számára az FAR.AI vezette konzorcium vizsgálja a CBRN-kockázatokat. A hároméves munka vegyi, biológiai, radiológiai és nukleáris fenyegetésekre vonatkozó kockázati modelleket és értékelési eszközöket készít.
Vállalati AI-platformok és ügynökök
A Factory 100 millió dolláros partnerhálózatot indít tanácsadók és rendszerintegrátorok képzésére, bevezetésre, megoldásokra és marketingre. A cél nagyvállalati, AI-alapú szoftvergyárak tervezése és működtetése.
A OpenRouter a Stripe-hoz csatlakozik, miközben a felhasználói integrációk, a termék, a név és a fejlesztési terv változatlan marad. A Salesforce a Headless 360-at terjeszti ki, hogy az arra jogosult ügynökök nyílt szabványokon keresztül használhassák a vállalati képességeket.
A fejlesztői oldalon a Cursor felhős ügynökei eseményekre is reagálnak, hosszabb célokat követnek és pull requesteket kezelnek. A Vercel Agent Slackben is vizsgálhat incidenseket, a LangChain pedig automatikus értékelőt indított az ügynökök hibáinak felismerésére.
Kutatási eredmények és szabályozási viták
Az MIT CSAIL az attribúció elhalásáról számolt be: a képgeneráló modellek kimenete gyakran nem köthető egyetlen tanítóképhez, művészhez vagy személyhez. Az Apple kutatása szerint kilenc LLM-bíró információtartalma nagyjából két független szavazatnak felel meg.
A Cohere több mint 5,6 millió tanítási minta elemzésével arra jutott, hogy a többnyelvűség önmagában nem biztosít kulturális érzékenységet. Közben a washingtoni vitákban hiányzó biztonsági és értékelési eszközöket, valamint nemzetközi vörös vonalakat sürgettek.
További vállalati bejelentések
Az Amazon közel 500 amerikai városra bővítené drónos kiszállítását, az Alexa+ pedig külön díj nélkül érkezik kompatibilis Fire TV eszközökre. A Liquid AI négy új, 4 bites modellt adott ki, a Vercel AI Gatewayben pedig Fish Audio-modellek váltak elérhetővé.
Az OpenAI közlése szerint a Replit Free Mode-ban GPT-5.6 Luna segíti a szoftverkészítést. Az OpenAI emellett 31 európai piacra bővíti a ChatGPT Ads programot, a Samsung pedig 158 millió dolláros HVAC-üzemet épít Koreában.


