Назад
Керівники голосового AI: технологія ще не мала моменту ChatGPT
SiTech AI Team2 хв читання

Керівники голосового AI: технологія ще не мала моменту ChatGPT

Керівники PolyAI та Otter кажуть, що голосовому AI все ще бракує швидкого мислення, точної транскрипції та прозорості, незважаючи на мільярдні інвестиції та появу моделей повного дуплексу.

Голосовий AI привабив мільярди інвестицій і постійний потік нових моделей, які стверджують, що слухають та спілкуються як люди, однак керівники PolyAI та Otter кажуть, що технологія ще не мала свого моменту ChatGPT. Ці коментарі були зроблені на сцені минулого місяця під час розмов на конференції HumanX.

Моделі повного дуплексу вже є, швидкості мислення — ні

Технічний директор PolyAI, корпоративної платформи голосового AI, Шон Вен сказав, що індустрія досягла етапу, коли створено моделі повного дуплексу, які можуть вести розмову паралельно зі слуханням дзвінка. За його словами, наступний виклик — зробити мислення настільки швидким, щоб моделі швидко знаходили відповіді й розмова сприймалася природньо. Вен додав, що агенти обслуговування клієнтів не повинні звучати як роботи і мають викликати впевненість, що проблеми вирішаться. За його словами, коли голос стане достатньо хорошим для перших двох чи трьох ходів розмови, користувачі з часом набудуть довіри й втратять відчуття необхідності спілкуватися з людиною.

Ботам для зустрічей потрібно більше, ніж точна транскрипція

Алекс Гейм, директор з маркетингу Otter, додатку для запису зустрічей, сказав, що ідентифікація співрозмовника, відображення намірів та зв’язування транскрипцій із організаційними знаннями є головними кроками до автоматизації. Otter також працює над цифровими аватарами, які можуть представляти людей на зустрічах, і, за словами Гейма, вихідний голос має нести такий самий емоційний вираз, як під час розмови з людиною. Він зазначив, що найкращі зустрічі охоплюють дебати та стратегічні обговорення, основою яких є взаємини, і без цього аватар — це лише чат-бот із питаннями й відповідями.

Прозорість і довіра

Обидва лідери назвали точність перешкоджуючим фактором. Вен сказав, що моделі розпізнавання мовлення часто пропускають важливі ключові слова, що перешкоджає передачі повного контексту. Гейм погодився і сказав, що для Otter транскрипція ніколи не була кінцевою метою, а лише рівнем, від якого залежить зростання продуктивності, і що помилкові транскрипції ведуть до помилкових подальших дій та втрати довіри до платформи. Обговорюючи прозорість, Гейм сказав, що інструменти мають повідомляти користувачам, коли їх записують або коли вони розмовляють з AI, а Otter хоче повідомляти всім у чаті, що зустріч буде записано навіть тоді, коли його бот там немає. Вен сказав, що на корпоративних дзвінках не менш важливо визначати, що люди розмовляють з AI.

Джерела: Techcrunch Ai

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.