A Voyage AI új modellje a kódolási ügynökök kereséseit gyorsítaná
A Voyage AI bemutatta a voyage-code-4 kódbeágyazási modellt, amelyet kifejezetten programozási ügynökök kódkeresési feladataira fejlesztett. A vállalat szerint az új modell több tesztben is felülmúlja a Cohere és a Google hasonló megoldásait, miközben használata olcsóbb a korábbi verziónál.
- A voyage-code-4 kódolási ügynökök szemantikus keresésére készült.
- A Voyage AI szerint 28,25 százalékkal előzi meg a Cohere Embed v4-et az új ügynöki teszten.
- Az ár 0,12 dollár egymillió tokenenként.
- Az első 200 millió token ingyenes.
- A modell négy embeddingméretet és több kvantálási lehetőséget támogat.
A hibaleírásokból is releváns kódot keres
A voyage-code-4 célja, hogy a kódolási ügynökök akkor is megtalálják a módosítandó fájlokat, amikor a keresés nem egy konkrét függvény- vagy változónevet, hanem egy hibajelenséget ír le. A Voyage AI példaként azt említi, amikor egy ügynök azt keresi, hol kezelik helytelenül az üres tömböket.
A fejlesztők által használt teljes szöveges keresés, például a grep, akkor működik jól, ha ismert a keresett azonosító. Egy tünetet vagy hibajelentést leíró lekérdezésnél viszont kevés hasznos találatot adhat, ezért az ügynök további kéréseket indít, és több tokent használ fel. A szemantikus keresés ezt egészíti ki azzal, hogy a lekérdezés jelentése alapján próbálja megtalálni a kapcsolódó kódot.
Pull requestekből építették az új tanítóanyagot
A Voyage AI szerint a hagyományos kódbeágyazási modelleket gyakran forrásfájlok és dokumentációk, megjegyzések vagy mesterséges kérdések párosításán tanítják. Ez segít megérteni, miről szól a kód, de kevésbé tanítja meg, hogy egy adott kódrészlet mit csinál rosszul egy hibajelentés alapján.
A voyage-code-4 tanítóanyagát ezért elkészült pull requestekből származó, természetes nyelvű lekérdezések és kódok alapján állították össze. A korpusz több százezer lekérdezést, több tízezer tárolót és több száz programozási nyelvet foglal magában. A vállalat közlése szerint ez lényegesen nagyobb a voyage-code-3 tanításához használt kódadatbázisnál.
A teszteken több vetélytársat is megelőzött
A modell teljesítményét két tesztsorozaton vizsgálták. Az első 19, hibajavító pull requestekből felépített tesztet tartalmazott. Ezekben a lekérdezés egy hibaleírás volt, a releváns dokumentumok pedig a beolvasztott javítás által érintett fájlok. A tesztadatok olyan tárolókból származtak, amelyek nem szerepeltek a tanításban.
A Voyage AI szerint a voyage-code-4 ezen az úgynevezett agentic code retrieval teszten átlagosan 28,25 százalékkal teljesített jobban a Cohere Embed v4-nél, és 31,03 százalékkal a Gemini Embedding 2-nél. A voyage-code-3-hoz képest az előnye 27,54 százalék volt, az OpenAI v3 large modellhez képest pedig 48,58 százalék.
A korábbi, 28 kódkeresési adathalmazt használó összehasonlításban az új modell 19,21 százalékkal múlta felül a Cohere Embed v4-et, a Gemini Embedding 2-nél pedig 16,01 százalékkal bizonyult jobbnak. A mérésekben a lekérdezésekhez tartozó tíz legjobb találat minőségét vizsgálták.
Alacsonyabb áron érhető el
A voyage-code-4 a Voyage API-n, valamint a MongoDB Atlas Embedding and Reranking API-n keresztül érhető el. Az ára 0,12 dollár egymillió tokenenként, ami a vállalat szerint a voyage-code-3 árának egyharmadával alacsonyabb. Az első 200 millió token ingyenes.
A modell 2048, 1024, 512 és 256 dimenziós beágyazásokat támogat. Elérhető a 32 bites lebegőpontos, az előjeles és előjel nélküli 8 bites egész számos, valamint a bináris kvantálás is. A Voyage AI ezt a Matryoshka learning technikával kapcsolja össze, amely a vállalat közlése szerint lehetővé teszi a kisebb reprezentációk használatát a minőség jelentős romlása nélkül. A bejelentés 2026. augusztus 13-án jelent meg.
Voyage AI: voyage-code-4: code retrieval built for coding agents

