AI-biztonság

Ötféle adatvédelmi kockázatot azonosított az MLCommons az AI-ügynököknél
Az MLCommons közzétette az AI-ügynökök adatvédelmi kockázatainak első taxonómiáját. A dokumentum öt fő területet különít el, a begyűjtött adatok kezelésétől az…

Az uniopen az Amazon Nova finomhangolásával javította a moderálást
Az uniopen az Amazon Nova 2 Lite modellt saját kiskereskedelmi moderálási szabályaihoz igazította. A finomhangolás és egy későbbi promptmódosítás után mindkét vizsgált…

Az uniopen üzleti szabályokra hangolta az Amazon Nova moderációját
Az AWS bemutatta, hogyan szabta testre a tajvani uniopen az Amazon Nova 2 Lite modellt saját tartalommoderációs szabályaihoz. A felügyelt finomhangolás és egy további…

Az Enkrypt AI a ChatGPT Enterprise kockázatainak vizsgálatát segíti
Az Anaconda által bemutatott Enkrypt AI az OpenAI Compliance API-hoz kapcsolódva vizsgálja a ChatGPT Enterprise munkaterületeinek aktivitását. A szolgáltatás utólag…

Az Enkrypt AI a ChatGPT Enterprise kockázatait vizsgálja
Az Enkrypt AI az OpenAI Compliance API-hoz kapcsolódva vizsgálja a ChatGPT Enterprise munkaterületeinek tevékenységét. A szolgáltatás utólag, ütemezett ellenőrzésekkel…

28 kutató kapott AI2050-ösztöndíjat az AI hosszú távú kihívásaira
A Schmidt Sciences 28 kutatót választott ki az AI2050 program ötödik évfolyamába. A kutatók három év alatt akár 16 millió dolláros támogatást kapnak az olyan hosszú távú…

28 kutató kapott AI2050-ösztöndíjat az MI hosszú távú kihívásaira
A Schmidt Sciences 28 kutatót választott ki az AI2050 program ötödik évfolyamába. A kutatók legfeljebb 16 millió dolláros, három évre szóló támogatással vizsgálják…

A Modal Sidecars konténerekkel választaná szét az ügynökök kódját
A Modal bemutatta a Sidecars nevű bétafunkciót, amely a fő Sandbox mellett futó, elkülönített konténerekkel választja szét a megbízható és nem megbízható kódot. A…

A Goodfire szerint a logitek új monitorként jelezhetik az értékelési tudatosságot
A Goodfire Research „Logits as a new monitor for evaluation awareness” címmel tett közzé kutatási bejegyzést. A cím alapján a munka azt vizsgálja, hogyan használhatók a…

A Datadog már telepítés előtt blokkolja a kártékony csomagokat
A Datadog Code Security új képességei szervezeti szinten kezelhetővé teszik a Supply Chain Firewallt, amely telepítés előtt blokkolja az ismert kártékony csomagokat. A…

Fehérjemodellek segíthetnek kiszűrni az AI-ügynökök biológiai kockázatait
A Goodfire olyan biosecurity-monitorokat fejlesztett, amelyek fehérjemodellekből származó embeddingekkel vizsgálják az AI-ügynökök által kezelt biológiai szekvenciákat.…

A Goodfire kutatási oldala már az arXiv-cikkhez irányít
A Goodfire „Adversarial Examples Are Not Bugs, They Are Superposition” című kutatási oldala jelenleg az arXiv-papírhoz irányítja az olvasókat. A megadott oldalon a…

A Goodfire kutatási oldala egy arXiv-cikkhez irányítja az olvasókat
A Goodfire „Open Problems in Mechanistic Interpretability” című kutatási oldala jelenlegi formájában egy arXiv-cikkhez irányítja az olvasókat. Az oldalon emellett a…

A Goodfire feltérképezte a DeepSeek R1 gondolkodási folyamatait
A Goodfire Research elkészítette az első ritka autoenkódereket a 671 milliárd paraméteres DeepSeek R1 reasoning modellhez, és nyílt forráskódúvá tette őket. A kutatók…

A Llama 3.3 70B belső működését térképezte fel a Goodfire
A Goodfire Research ritka autoenkóderekkel vizsgálta a Llama 3.3 70B köztes rétegének jellemzőit. A kutatás szerint ezek a jellemzők a modell viselkedésének elemzésére…

Négy új mélyhamisítási ügy mutatja, hol sérülékeny az AI
Kilencvenöt millió eurós banki csalás, Grok által létrehozott intim képek, kormányzati rendszereket vizsgáló AI-ügynökök és egy bírósági ügy szerepel a Resemble AI heti…

Az Agility és a FORT Robotics közösen fejleszti a Digit 5 biztonságát
Stratégiai partnerséget kötött az Agility Robotics és a FORT Robotics a Digit 5 humanoid robot biztonsági infrastruktúrájának továbbfejlesztésére. Az együttműködés egy…

A Modal Sidecars konténerekkel választja szét az ügynökök kódját
A Modal bemutatta a Sidecars funkciót, amely ugyanazon a gépen, mégis elkülönítve futtat megbízható szolgáltatásokat a Sandboxok mellett. A vállalat szerint a megoldás…

A Datadog már telepítés előtt blokkolná a kártevő csomagokat
A Datadog Code Security új funkciói a telepítés előtt blokkolják az ismert kártevő csomagokat, és központi kezelést adnak a fejlesztői gépekhez és a CI-rendszerekhez. A…

Proteinmodellekkel javítaná az AI-ügynökök biológiai biztonságát a Goodfire
A Goodfire olyan biztonsági monitorokat fejlesztett AI-ügynökökhöz, amelyek a fehérjeszekvenciák és a feladat kontextusa alapján mérik a biológiai kutatási feladatok…

A Goodfire logitokkal vizsgálná, felismerik-e a modellek az értékelést
A Goodfire Research „Logits as a new monitor for evaluation awareness” címmel tett közzé kutatási anyagot a logitok lehetséges monitorozási szerepéről. A forrásoldalon…

A Goodfire kutatási oldala egy arXiv-tanulmányhoz irányít
A Goodfire Research oldalán szereplő „Adversarial Examples Are Not Bugs, They Are Superposition” című kutatási anyag jelenleg egy arXiv-tanulmányhoz irányítja az…

A DeepSeek R1 belső működését vizsgáló eszközöket tett közzé a Goodfire
A Goodfire Research két nyílt forrású sparse autoencodert tett közzé a 671 milliárd paraméteres DeepSeek R1 elemzéséhez. A kutatók szerint a modell belső működése több…

A Goodfire arXiv-publikációhoz irányítja át mechanisztikus értelmezési oldalát
A Goodfire kutatási oldala az „Open Problems in Mechanistic Interpretability” című anyag helyett egy arXiv-publikációhoz irányítja az olvasókat. Az oldal jelenlegi…