Mākslīgā intelekta balss asistenti sper vēl vienu soli tuvāk īstai cilvēku komunikācijai. OpenAI paziņojis par jauniem balss modeļiem GPT-Live-1 un GPT-Live-1 Mini, kas maina veidu, kā lietotāji sarunājas ar ChatGPT.
Ja līdz šim MI galvenokārt gaidīja, kad cilvēks pabeigs runāt, tad jaunā sistēma spēj vienlaikus klausīties un runāt, padarot dialogu daudz plūstošāku un dabiskāku.
Beidzot iespējams runāt kā ar cilvēku
Līdzšinējās balss sistēmas darbojās pēc principa “viens runā, otrs klausās”. Lietotājam bija jāpabeidz teikums, jāgaida atbilde un tikai tad saruna turpinājās.
Jaunie GPT-Live modeļi izmanto tā saukto full-duplex arhitektūru, kas ļauj mākslīgajam intelektam vienlaikus uztvert balsi un ģenerēt atbildes. Tas nozīmē, ka lietotājs var pārtraukt MI teikuma vidū, precizēt jautājumu vai mainīt tēmu, un sistēma spēj pielāgoties gandrīz reāllaikā.
OpenAI norāda, ka viens no galvenajiem uzlabojumiem ir spēja precīzāk noteikt, kad atbildēt uzreiz, kad vienkārši apstiprināt ar īsu reakciju un kad klusēt, ļaujot sarunas partnerim turpināt domu.
Vairs nav nepieciešamas trīs dažādas sistēmas
Iepriekš ChatGPT balss režīms balstījās uz vairāku modeļu sadarbību. Viens modelis pārvērta runu tekstā, otrs ģenerēja atbildi, bet trešais tekstu pārvērta balsī. Šāda pieeja radīja papildu aizturi un dažkārt lika asistentam pārtraukt lietotāju vai nepareizi interpretēt kontekstu.
Jaunā GPT-Live arhitektūra šo procesu apvieno vienotā sistēmā, kas ļauj ātrāk reaģēt un saglabāt vairāk sarunas konteksta.
Sarežģītus uzdevumus veiks citi modeļi
Interesanti, ka GPT-Live nav paredzēts tikai sarunām. Kad lietotājs uzdod sarežģītāku jautājumu, sistēma spēj fonā piesaistīt jaudīgākus OpenAI modeļus, tostarp jaunākās GPT paaudzes risinājumus.
Praksē tas nozīmē, ka balss saruna var turpināties bez pārtraukuma, kamēr fonā tiek veikta meklēšana internetā, loģiskā spriešana vai pat sarežģītāki aģentu tipa uzdevumi.
Tiešraides tulkošana un ilgstošas sarunas
Jaunā tehnoloģija paver iespējas arī reāllaika tulkošanai. Tā kā modelis vienlaikus klausās un runā, tas spēj tulkot sarunu gandrīz bez aizkaves.
OpenAI demonstrācijās parādīja, ka sistēma spēj uzturēt ļoti garas sarunas. Uzņēmuma pārstāvji atklāja, ka testu laikā ar balss režīmu notikušas pat 30 līdz 40 minūtes ilgas nepārtrauktas diskusijas. Turklāt modelis spēj ilgstoši klusēt un vienkārši klausīties, nepārtraucot lietotāju pēc katras pauzes.
Vizuālas atbildes tieši sarunas laikā
Jaunie balss modeļi iegūst piekļuvi arī vizuālajām kartītēm. Sarunas laikā ChatGPT varēs attēlot kartes, laikapstākļu informāciju, sporta rezultātus vai citus vizuālus elementus, neaprobežojoties tikai ar balsi.
Tas pakāpeniski tuvina MI asistentus universālai saskarnei starp lietotāju un digitālajiem pakalpojumiem.
OpenAI redz balsi kā nākotnes interfeisu
Uzņēmums uzskata, ka balss nākotnē var kļūt par galveno veidu, kā cilvēki mijiedarbojas ar datoriem. Tā vietā, lai rakstītu komandas vai klikšķinātu pa izvēlnēm, lietotājs vienkārši runātu ar sistēmu.
Šāda pieeja kļūst īpaši aktuāla laikā, kad arvien vairāk AI rīku spēj veikt daudzpakāpju uzdevumus bez cilvēka tiešas iesaistes.
Pieejamība un abonementu atšķirības
Jaunais balss režīms jau sāk nonākt pie lietotājiem Android, iOS un tīmekļa versijā. Bezmaksas lietotāji saņems GPT-Live-1 Mini, savukārt maksas abonementu īpašnieki varēs izmantot pilno GPT-Live-1 modeli ar augstāku intelekta līmeni un precīzākām atbildēm.
Pagaidām jaunā sistēma vēl neatbalsta ekrāna kopīgošanu un video straumēšanu, taču OpenAI sola šīs iespējas pievienot vēlāk.
Ne viss vēl ir ideāli
Lai gan tehnoloģija ir ievērojami attīstījusies, OpenAI atzīst, ka sistēmai vēl ir kur augt. Demonstrācijās redzams, ka dažās valodās izruna joprojām var šķist nedabiska, īpaši ārpus angļu valodas.
Tomēr GPT-Live ir viens no līdz šim ambiciozākajiem mēģinājumiem radīt MI, ar kuru iespējams sarunāties tikpat dabiski kā ar cilvēku. Un, spriežot pēc OpenAI plāniem, balss asistenti tuvākajos gados kļūs par daudz nozīmīgāku ikdienas tehnoloģiju daļu nekā jebkad agrāk.
Avots: TechCrunch






























