OpenAI і Alibaba показали нові системи для розпізнавання мови

class=”ArticleImagestyles__ImageWrapper-sc-lvd8v9-0 cWMVnY”>

OpenAI та Alibaba представили нові AI-моделі для розпізнавання мовленняOpenAI представила дві нові системи для перетворення аудіо на текст — GPT-Live-Transcribe та GPT-Transcribe. Перша розроблена для обробки аудіо в реальному часі з мінімальною затримкою, тоді як друга призначена для аналізу попередньо записаних звукових файлів та пакетної транскрипції. Обидві системи демонструють поліпшене розуміння контексту, що сприяє точнішій ідентифікації термінології, імен власних та різних мов.Про це інформує neowin.net.

OpenAI вдосконалила інструменти для транскрипції

За даними OpenAI, врахування контексту суттєво покращує якість транскрипції. Компанія також стверджує про зниження частоти помилок порівняно з попередніми рішеннями Whisper. Незалежне тестування від Artificial Analysis підтвердило високу точність GPT-Transcribe, а вартість використання цієї моделі становить 4,5 долара за 1000 хвилин аудіо.

Alibaba презентувала нові голосові системи

Водночас Alibaba анонсувала нові моделі Qwen-Audio-3.0-Realtime Plus і Flash, що функціонують за принципом «мовлення — мовлення». Вони підтримують природну діалогову взаємодію в реальному часі, дозволяють користувачеві переривати відповідь штучного інтелекту, а також дають змогу викликати функції та створювати індивідуалізовані копії голосу.Згідно з рейтингом Artificial Analysis, модель Qwen-Audio-3.0-Realtime Plus наразі перевершує рішення від OpenAI за якістю діалогової взаємодії «мовлення — мовлення», здобувши 84,1% проти 79,1% у GPT-Realtime-2.1 High. Однак, модель від Alibaba поступається за швидкістю: її відповідь починається приблизно через чотири секунди, тоді як система OpenAI реагує трохи більше ніж за одну секунду.За матеріалами: iTechuaЧат ботOpenAIChatGPTМісце для вашої реклами

Джерело

No votes yet.
Please wait...

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *