A GitHub bemutatta a Project HydraFusion kutatási előzetesét

A GitHub 2026. szeptember 4-én bemutatta a Project HydraFusion nevű kutatási előzetest. A rendszer a GitHub Copilotban több szolgáltató modelljei közül választ, és futás közben állít össze munkafolyamatot a fejlesztői feladatokhoz.
- A GitHub 2026. szeptember 4-én mutatta be a Project HydraFusion kutatási előzetest.
- A rendszer futás közben választ több modell és munkafolyamat közül a Copilot feladataihoz.
- Három végrehajtási mintát használ: Single, Cascade és Critique.
- TerminalBench 2.1 alatt 4,9 százalékponttal jobb minőséget és 67 százalékkal alacsonyabb becsült költséget közölt az Opus 5-höz képest.
- A GitHub szerint a kutatási előzetes célja a valós fejlesztői terhelések validálása.
Több modell egy feladat mögött
A GitHub közlése szerint a Project HydraFusion célja, hogy a fejlesztők úgy kapjanak magas szintű modellképességeket, hogy közben ne nekik kelljen kézzel kiválasztaniuk, melyik modell alkalmas az adott feladatra. A vállalat korábban már bevezette az Auto model selection funkciót, amely megvizsgálja a feladatot, majd hozzárendeli az ahhoz leginkább illő modellt. A HydraFusion ezt a megközelítést viszi tovább futásidejű összehangolással.
A kutatási előzetes teljes végrehajtási tervet készít. A GitHub leírása alapján modelleket választ több szolgáltatótól, majd ezekkel készíttethet vázlatot, kritikát és javítást, vagy szükség esetén erősebb modellekre terelheti a feladatot. A fejlesztő ebből a folyamatból annyit lát, hogy a HydraFusiont ugyanúgy kiválaszthatja, mint bármely más modellt.
A GitHub szerint a HydraFusion a teljes stratégiában az automatikus szemantikus útválasztás egyik eleme, amely helyi, felhős és összetett modellek között működhet. A rendszer minden feladathoz olyan munkafolyamatot választ, amely a teljesítmény, a költség és a késleltetés egyensúlyát keresi.
Három végrehajtási minta közül választ
A HydraFusion a munkafolyamat kiválasztását optimalizációs problémaként kezeli. Ehhez képességjeleket használ az érvelés, a kódgenerálás, a hibakeresés és az eszközhasználat területéről. A cél az, hogy a rendszer a minőségi elvárás teljesítéséhez a leghatékonyabb végrehajtási mintát válassza.
A GitHub jelenlegi leírása három mintát említ. A Single esetben egy kiválasztott modell közvetlenül megoldja a feladatot. A Cascade mintánál egy hatékony modell készít első megoldást, majd egy minőségi kapu dönt arról, elfogadható-e az eredmény, vagy erősebb modellhez kell továbbítani. A Critique esetben az egyik modell elkészíti az eredményt, majd egy másik modellcsaládból származó, csak olvasási jogú kritikus átnézi azt, végül a készítő modell egyszer javít rajta.
A vállalat szerint ezek a minták eltérő minőség és költség közötti kompromisszumokra valók. A Single a sebességet és a hatékonyságot tartja meg, ha egy modell önmagában is elég. A Cascade esélyt ad az olcsóbb vagy hatékonyabb első próbálkozásnak, miközben megmarad az út az erősebb következtetés felé. A Critique olyan feladatoknál hasznos, ahol egy független ellenőrzés többet érhet, mint egy újabb önálló próbálkozás.
Hogyan tartja kézben a végrehajtást
A GitHub szerint a repository szintű munkához a többmodelles összehangolás csak akkor működik megbízhatóan, ha a végrehajtás, az ellenőrzés, a költség és a repository állapota kontroll alatt marad. A HydraFusion ezért öt működési elvre épül.
- Teljes elszámolás: a rendszer összesíti a költséget és a használatot minden munkafolyamat-lépésnél, beleértve a vázlatkészítést, kritikát, javítást, eszkalációt, újrapróbálkozást és tartalék megoldást.
- Korlátozott végrehajtás: minden lépéshez külön időtúllépési és megszakítási viselkedést rendel, hogy a futás és a költség meghatározott keretek között maradjon.
- Elkülönített ellenőrzés: az ellenőrzési lépések izolált, eszköz nélküli környezetben futnak, miközben a megoldó lépések a közös munkaterületet és a megszokott, jogosultságokat figyelembe vevő agent ciklust használják.
- Biztonságos alkalmazás: ha a munkafolyamat megszakad vagy nem megy át az ellenőrzésen, nem kerül patch a repositoryba.
- Validált útválasztás: a végrehajtás előtt ellenőrzi a munkafolyamat-definíciókat, a modellhozzárendeléseket, a tartalék viselkedést és a modellek elérhetőségét.
Belső működésben a runtime rögzíti az egyes lépések szerepét, kimenetelét, költségét, késleltetését és diagnosztikai adatait. A fejlesztő kívülről egy egységes választ és egy jogosultságokat figyelembe vevő módosítási csomagot kap.
Mit mutattak a benchmarkok
A GitHub rögzített HydraFusion-szabályzatokat értékelt három agentikus kódolási benchmarkon: TerminalBench 2.1, DeepSWE és CheckpointBench. Utóbbi a vállalat belső benchmarkja, amely valós GitHub Copilot munkameneteken alapul. Az összehasonlítási alapok Claude Opus 5 és GPT-5.6 Sol voltak.
Az értékelésben minden szabályzat ugyanazokat a feladatbemeneteket, eszközöket, végrehajtási limiteket, árazási feltételezéseket, értékelési feltételeket és hiányzó eredményekre vonatkozó kezelést használta. A mért mutató az ellenőrzött feladatminőség volt, vagyis azoknak a feladatoknak az aránya, amelyeket helyesen megoldottnak erősítettek meg. A teljes becsült munkafolyamat-költségbe minden meghívott lépés beleszámított.
A GitHub által közölt legjobbra hangolt HydraFusion-konfiguráció a TerminalBench 2.1 teszten 4,9 százalékponttal jobb ellenőrzött feladatminőséget ért el, miközben a becsült költség 67 százalékkal alacsonyabb volt a Claude Opus 5-höz képest. A DeepSWE esetében a minőség 1,5 százalékponttal maradt el az Opus 5-től, a becsült költség pedig 36 százalékkal volt alacsonyabb. A CheckpointBench eredménye 0,1 százalékpontos elmaradás és 65 százalékkal alacsonyabb becsült költség volt.
A GitHub hangsúlyozta, hogy ezek kontrollált offline eredmények, amelyek az adott benchmark-verziókra, munkafolyamat-konfigurációkra, modellkészletre és árazási feltételezésekre vonatkoznak. Minden modellt azonos, közepes érvelési szinten értékeltek.
Mit jelenthet ez a fejlesztőknek
A HydraFusion a GitHub leírása alapján azt a kézi gyakorlatot automatizálja, amikor a fejlesztők egy modellt kérnek fel a feladatra, egy másikat az ellenőrzésre, vagy egy nehezebb problémát erősebb modellhez visznek tovább. A kutatási előzetesben a felhasználó egyszer választja ki a HydraFusiont, a rendszer pedig a háttérben kezeli a modelleket és a munkafolyamatot.
A gyakorlati ígéret a szelektivitás. Egyes kódolási feladatok közvetlenül megoldhatók, mások átnézést, javítást vagy eszkalációt igényelnek. A HydraFusion minden kérésnél azt a legkevésbé összetett munkafolyamatot próbálja választani, amely várhatóan teljesíti az igényt, és csak akkor használ további modellhívásokat, ha azok valószínűleg javítanak az eredményen.
A GitHub a kutatási előzetes során azt akarja ellenőrizni, hogyan fordíthatók át az offline benchmarkeredmények valós fejlesztői terhelésekre. A vállalat a tapasztalatokat a HydraFusion további optimalizálására használná a produkciós minőség, késleltetés, megbízhatóság, gyorsítótárazási hatékonyság, költség és biztonság területén.

