У меня ДЦП. Речь искажённая. Я хожу в голосовой ввод трёх топовых мировых нейросетей — ChatGPT, Claude и Grok — и ни одна не понимает, что я говорю. Совокупный бюджет этих трёх компаний — сотни миллиардов долларов. В манифестах у каждой красиво написано про safety и accessibility.
Ставлю рядом Яндекс Станцию Миди. Тринадцать тысяч рублей. «Алиса, включи музыку». Играет. Каждый раз, с первого захода, без переспрашиваний.
Знаете почему такая разница?
В июле две тысячи двадцать четвёртого Яндекс отдельно, целенаправленно дообучил Алису на речи людей с нарушениями. ДЦП, заикание, последствия инсульта, постравма. Восемьсот пятьдесят пять тысяч записей. Больше девятисот часов аудио. Разметку по типам нарушений делали специалисты-дефектологи из Московского городского педагогического университета. Разрыв в точности распознавания между обычной речью и искажённой сократился на двадцать процентов — по метрике Word Error Rate. Для лёгкой формы нарушений Алиса теперь распознаёт речь не хуже человека, для тяжёлой — даже лучше.
Помогали НКО: «Центр лечебной педагогики», «Живи сейчас», «Жизненный путь», «Весна», «Перспектива». Всё это заняло больше года работы.
Сэм Альтман двадцать четыре часа в сутки рассуждает про пользу человечеству. Дарио Амодей выпускает манифесты про безопасный ИИ. У них есть бюджеты, инженеры, и главное — своё распознавание речи через Whisper и внутренние движки. Что мешало собрать датасет с речью людей с нарушениями? Ничего. Просто не сделали.
Видимо, «безопасный ИИ» — это для тех, кто говорит как ведущий CNN. Для остальных safety не завезли.
И вот тут второй акт, о котором я вам скажу как человек, который каждый день сидит и в Клоде, и в Алисе. С Алисой говорить голосом — скучно. Она попугай в хорошем смысле: подтвердит команду, выдаст пару фраз по делу и вернёт тебе вопрос. Диалога с ней нет. Есть команды и заготовленные ответы.
А в чате с Клодом я разговариваю по-настоящему. Он думает, спорит, разбирает по кускам, возвращается к тому, что я сказал три сообщения назад. Голосом с ним я бы говорил каждый день, часами. Только голосом он меня не слышит.
Вилка получается смешная. Одна коробка меня слышит, но собеседник из неё — как из телеграм-бота с кнопками. Другой — реальный собеседник, но только пока я могу печатать.
Российская Алиса тут выиграла один раунд из двух. Раунд accessibility. Второй раунд — по глубине диалога — за западными. И пока никто не сделал коробку, где есть оба.
Кто пользуется голосовым вводом у ChatGPT или Клода с любым акцентом или картавостью — расскажите как оно у вас. Интересно, я один такой или это системная история.