:

Szerző: Dömös Zsuzsanna

2023. március 2. 13:55

Beszédfelismerő API-t indít útnak az OpenAI

Élőbeszédből készít szöveget a Whisper API, ami a fejlesztők széles köre előtt nyílik meg.

Az OpenAI amellett, hogy mától lehetővé teszi a ChatGPT API-jának használatát a chatszolgáltatásokat készítő külső fejlesztők számára, bejelentette a Whisper API-t is, ami a Whisper nevű beszéd-szöveg modell integrálására ad lehetőséget. Az új alkalmazásprogramozási-interfésszel a cég megfogalmazása szerint a modellt sikerült extrém szinten optimalizálni, így gyorsabban és hatékonyabban dolgozik, így átírási képességei a meglévő alkalmazások, szolgáltatások, termékek és eszközök fejlesztését remekül szolgálhatják szélesebb körben is.

Nyerd meg az 5 darab, 1000 eurós Craft konferenciajegy egyikét!

A kétnapos, nemzetközi fejlesztői konferencia apropójából a HWSW kraftie nyereményjátékot indít.

Nyerd meg az 5 darab, 1000 eurós Craft konferenciajegy egyikét! A kétnapos, nemzetközi fejlesztői konferencia apropójából a HWSW kraftie nyereményjátékot indít.

A percenként 0,006 dollárba kerülő Whisper egy automatikus beszédfelismerő rendszer, amely az OpenAI állítása szerint több nyelven is hatékony készít szöveges leiratot, illetve fordításra is használható, támogatja az M4A, MP3, MP4, MPEG, MPGA, WAV és WEBM formátumokat. 

Greg Brockman, az OpenAI elnöke szerint a Whisper abban különbözik a konkurens megoldásoktól, hogy hatalmas adatmennyiségen képezték ki, 680 ezer órányi  felvételt használtak fel az internetről számos nyelven, amivel hatékonyabban tudja felismerni a modell az olyan apró nüanszokat, mint az egyedi akcentusok, a különféle háttérzajok és a technikai szakzsargonok.

A hangátírási technológiák elterjedése előtt egyelőre rengeteg akadály van, a Statista 2020-as felmérése szerint a cégek több okból sem használnak aktívan mindennapi működésükhöz ilyen eszközöket, említve fő problémaként a nyelvjárásokkal kapcsolatos felismerési problémákat és a költségeket.

A Whispernek szintén vannak korlátai, főleg prediktivitás, azaz az egymás után következő kifejezések előrejelzése terén szorul további finomításra. Az OpenAI is felhívja a figyelmet arra, hogy a Whisper olyan szavakat is beleszőhet az átiratokba, amelyek valójában nem hangzottak el, valószínűleg azért, mert egyszerre próbálja megjósolni a következő szót, és magát az elhangzó szavakat is figyeli.

Továbbá egyelőre nem ugyanolyan hatékony az összes nyelven, nagyobb a hibaarány, ha olyan nyelvek beszélőiről van szó, amelyekhez kapcsolódóan kevesebb adat állt rendelkezésre a kiképzés során.

Milyen technológiai és munkaerőpiaci hatások érhetik a backendes szakmát? Május 8-án végre elindul az idei kraftie! meetup-sorozat is (helyszíni vagy online részvétellel).

a címlapról

Hirdetés

Security témákkal folyatódik az AWS hazai online meetup-sorozata!

2024. április 26. 14:21

A sorozat május 28-i, harmadik állomásán az AWS-ben biztonsági megoldásait vesszük nagyító alá. Átnézzük a teljes AWS security portfóliót a konténerbiztonságtól a gépi tanulásos alkalmazások védelmén át, egészen az incidenskezelésig.