class=”ArticleImagestyles__ImageWrapper-sc-lvd8v9-0 cWMVnY”>

OpenAI та Alibaba представили нові AI-моделі для розпізнавання мовленняOpenAI представила дві нові системи для перетворення аудіо на текст — GPT-Live-Transcribe та GPT-Transcribe. Перша розроблена для обробки аудіо в реальному часі з мінімальною затримкою, тоді як друга призначена для аналізу попередньо записаних звукових файлів та пакетної транскрипції. Обидві системи демонструють поліпшене розуміння контексту, що сприяє точнішій ідентифікації термінології, імен власних та різних мов.Про це інформує neowin.net.
OpenAI вдосконалила інструменти для транскрипції
За даними OpenAI, врахування контексту суттєво покращує якість транскрипції. Компанія також стверджує про зниження частоти помилок порівняно з попередніми рішеннями Whisper. Незалежне тестування від Artificial Analysis підтвердило високу точність GPT-Transcribe, а вартість використання цієї моделі становить 4,5 долара за 1000 хвилин аудіо.
Alibaba презентувала нові голосові системи
Водночас Alibaba анонсувала нові моделі Qwen-Audio-3.0-Realtime Plus і Flash, що функціонують за принципом «мовлення — мовлення». Вони підтримують природну діалогову взаємодію в реальному часі, дозволяють користувачеві переривати відповідь штучного інтелекту, а також дають змогу викликати функції та створювати індивідуалізовані копії голосу.Згідно з рейтингом Artificial Analysis, модель Qwen-Audio-3.0-Realtime Plus наразі перевершує рішення від OpenAI за якістю діалогової взаємодії «мовлення — мовлення», здобувши 84,1% проти 79,1% у GPT-Realtime-2.1 High. Однак, модель від Alibaba поступається за швидкістю: її відповідь починається приблизно через чотири секунди, тоді як система OpenAI реагує трохи більше ніж за одну секунду.За матеріалами: iTechua# Чат бот# OpenAI# ChatGPTМісце для вашої реклами