История голосовых помощников, часть I: говорящие машины и имитация голоса. От «А» и mama до фонографа
Перед тем, как появились полноценные голосовые помощники — Сири, Кортана, Алекса, Алиса и другие в XXI веке — была проделана гигантская работа, позволившая мечтам стать реальностью.
Которобот, Япония, 1963. Тоже, своего рода, говорящая машина для распугивания мышей, которые быстро привыкли к «чучелу», его сверкающим глазам и мяуканию
Задолго до ИИ, цифровой эры и даже электричества изобретатели начали свой путь к говорящим машинам, которые стали первым серьезным шагом к воплощению проектов полноценных помощников; в XX веке исследователи перешли к другой важной задаче — распознаванию голоса и команд, а уже в цифровую эпоху стало возможным создать первые варианты голосовых ассистентов. Сегодня — о том, как в XVIII веке ученые заставили неживые машины имитировать человеческие голоса.
Перед прочтением скромно напомним, кто мы: MANGO OFFICE, лидер IP-телефонии и виртуальных АТС в России по версии CNews (2021-2024), разработчик 200+ функций для бизнес-коммуникаций. А еще у нас есть Голосовые роботы — в отличие от героев сегодняшней статьи, они самостоятельные, современные, умеют поддерживать разговор и не пугают собеседника потусторонним тоном☺
Дед Чарльза Дарвина
Где-то в 1771 году Эразм Дарвин, врач по специальности и изобретатель в душе, построил свою говорящую машину — раньше, чем другие герои этой статьи, независимо от их ранних разработок. Что интересно, это произошло из-за азарта Эразма — промышленник Мэттью Болтон, друг Дарвина и участник знаменитого Лунного общества (Lunar Society), заключил с ним пари на 1000 фунтов — колоссальную по тем временам сумму — что тот не сможет построить инструмент, способный произносить «Отче наш», Символ веры и Десять заповедей на английском языке. Формальная письменная расписка от 3 сентября 1777 года сохранилась до наших дней и подтверждает условия ставки.


Эразм (1) и Чарльз (2) Дарвины
Эразм описал получившееся (и не дошедшее до нас) устройство сам. Машина представляла собой деревянный рот с губами из мягкой кожи, а с задней стороны — клапан, имитирующий носовые полости; оба элемента быстро открывались и закрывались нажатием пальцев. «Голосовой» звук создавала шёлковая лента длиной около 2,5 см и 6 мм шириной, натянутая между двумя кусочками слегка вогнутого гладкого дерева: когда лёгкий поток воздуха от мехов обдувал край ленты, она вибрировала между деревянными сторонами, издавая приятный тон, напоминающий человеческий голос. По собственным словам Дарвина, для расширения возможностей машины требовалось не более 13 движений, которые теоретически можно было бы связать с клавишами клавесина или фортепиано.
Christophe Veaux of Edinburgh University (реконструкция с 42 секунды)
Машина умела произносить mama, papa, map и pam, но до «Отче наш» и десяти заповедей было еще далеко, а с набором из p, b, m и a далеко не уйдешь. Поэтому пари он все-таки проиграл и 1000 фунтов не получил (сегодня это были бы 272 000 долларов). Интересна позиция самого Эразма — он себя позиционировал в первую очередь как врач, поэтому «побочные квесты» занимали меньше его внимания и времени, чем хотелось бы.
5 звуков Христиана Кратценштейна
В 1779 году датчанин Христиан Кратценштейн, действительный член Российской академии наук, создал модель речевого тракта — она могла произносить 5 гласных звуков при помощи вибрирующих язычков, задеваемых воздушным потоком.
К сожалению, само устройство до нас не дошло, но по описаниям его смогли восстановить — реконструкция выглядит вот так:
Реконструкция выполнена Serge Durin, за что мы очень ему благодарны
Славься, король: лесть аббата Микаля
Аббат Микаль в 1783 году представил королю свое собственное изобретение — говорящие головы на роликовом приводе, которые могли произносить заранее определенное количество фраз, имитируя человеческий голос. Несмотря на то, что имитация была весьма несовершенной, изобретение было новаторским, что было признано Академией наук.
Управление осуществлялось двумя разными клавиатурами: одна была связана с цилиндром (как в музыкальной шкатулке) и позволяла произносить лишь фиксированный набор фраз, но с правильно расставленными паузами между словами и правильной просодией; вторая клавиатура давала доступ ко всем звукам французского языка, сведённым изобретателем к небольшому числу комбинаций, и теоретически позволяла «набирать» пальцами любую фразу — как на пишущей машинке.
Финансовой поддержки, правда, Микаль не получил — и остался должен скульптору, который изготовил головы. К сожалению, до нас дошли только очень скудные описания устройства, которое, тем не менее, считается первым заранее программируемым голосовым симулятором некоторыми историками.
Странно, что Людовик XVI не смилостивился и не проспонсировал аббата — головы вели буквально следующий диалог (на французском):
— Король дарует Европе мир.
— Мир венчает короля славой.
— И мир делает народ счастливым.
— О обожаемый король, отец своего народа, их счастье являет Европе славу твоего трона.
Правда, комиссия, которой демонстрировалось изобретение, и не включала короля. Возьмем на себя дерзость предположить, что на фоне другого объекта оценки той же комиссии 1783 года — полет монгольфьера — невнятно говорящие головы действительно меркли.
20 лет разработки Вольфганга фон Кемпелена
Параллельно с Кратценштейном Вольфганг фон Кемпелен, венгеро-австрийский изобретатель, разрабатывал свою говорящую машину. Потратив 20 с лишним лет, в 1791 году он представил свое произведение инженерной мысли — с сегментами, функционально имитирующими рот, голосовые связки, легкие для забора воздуха и нос для носовых согласных (если любопытно, можно увидеть первоисточник тут). В первой версии роль легких взяли на себя кухонные меха, а само оно издавало только гласные.
Чертеж деталей говорящей машины 1791 года. Мехи действуют как легкие, подавая воздух в голосовую камеру, где находится вибрирующая язычковая мембрана. Звуки образуются за счет клапанов.
Интонацию эта машина не передавала, но издавать звуки и целые слова вполне могла — особенно легко ей давались латынь, французский или итальянский, а вот о немецкий устройство спотыкалось из-за нагромождения согласных.
Реконструкция Alexander Steinbeißer. Не ищите внешнее сходство с человеческим речевым аппаратом — оригинал тоже выглядел весьма не антропоморфно, судя по чертежам
Кстати, вы вполне могли слышать о Вольфганге фон Кемпелене раньше — это он придумал шахматный аппарат «Механический турок», снаружи которого была восковая фигура усача в экзотическом наряде, а внутри — сидел сильный шахматист. Видел доску он благодаря системе зеркал.
К сожалению, оригинал почил в XIX веке при пожаре в музее Филадельфии, но вот наиболее близкая реплика
Кемпелен катался со своим механическим детищем по Европе, давая туры, а после его смерти достался инженеру Мельцелю, при котором и играл с Наполеоном в 1809 году. Только в 1834 году шахматист Муре, один из живых «резидентов» механического турка, раскрыл секрет автомата, опубликовав статью в журнале, а в 1836 году об этом написал эссе Эдгар По (тот самый, вот перевод на русский). Впрочем, Мельцель даже после разоблачения кататься с гастролями не перестал…
XIX век представляет
Если XVIII и первая половина XIX века пытались буквально воссоздать анатомию речи (гортань, язык, губы), то вторая половина XIX века нашла обходной путь — фиксацию и повторное воспроизведение уже существующего звука.
Йозеф Фабер превзошел по «долгострою» даже Кемпелена — он потратил около 25 лет на Euphonia, что с греческого можно перевести как «красиво звучащая». Euphonia, она же Евфония, была представлена в 1845 году, хотя первую версию он презентовал пятью годами ранее — тогда же Йозеф и уничтожил свое «черновое» изобретение, разочаровавшись в результате. По легенде, Фаберу потребовалось семь лет только на то, чтобы добиться правильного произношения звука [e].
Конструкция была самой сложной среди всех говорящих машин своего времени: механическая копия человеческого горла и голосовых органов приводилась в движение клавиатурой из 16–17 клавиш, как у фортепиано, а меха под ножной педалью выполняли роль лёгких. Искусственная гортань была сделана из резины с подвижной голосовой щелью из тонких пластинок слоновой кости для регулировки натяжения, верхняя челюсть с кожаной губой оставалась неподвижной, а нижняя из гуттаперчи двигалась; язык, тоже резиновый, мог прижиматься к нёбу или отводиться назад к горлу. Заметьте, как имитирует строение человеческого речевого аппарата Евфония — у предыдущих машин «языка» и «губ» не было.


Иногда Эвфония выставлялась не только с женской маской (1), закрывавшей механический рот, язык и челюсть, но и с платьем. 2: Рисунок из The London Journal, 1870
Евфония могла говорить на английском, французском и немецком — правда, во всех языках с заметным немецким акцентом, поскольку оператором обычно выступала жена изобретателя, госпожа Фабер, немка по происхождению — судя по всему, фрау и машину заставляла звучать близко к своему родному языку.
Машина была наиболее продвинутой среди перечисленных нами — умела петь, включая исполнение гимна «God Save the Queen», на демонстрациях произносила вступительную фразу: «Простите за медленное произношение… Доброе утро, дамы и господа… Сегодня тёплый день… Сегодня дождливый день…». Несмотря на техническое совершенство, публика находила голос машины пугающим, «загробным» и монотонным — коммерческого успеха «Евфония» так и не добилась.
Записывай, а не имитируй: кукла Эдисона
В 1877 году, когда Томас Эдисон работал над телеграфом и телефоном, он попутно изобрёл фонограф — устройство фиксировало звуковые колебания через мембрану с иглой на вращающемся цилиндре, обёрнутом оловянной фольгой. Проверяя изобретение, Эдисон продекламировал в микрофон детский стишок «У Мэри был ягнёнок» и, к своему изумлению, услышал воспроизведённые собственные слова. Это уже не было синтезом речи в духе Кемпелена или Фабера — фонограф записывал и воспроизводил реальный голос, минуя всю проблему механической имитации артикуляции. Никаких попыток имитировать человеческие легкие, рот и голосовые связки — просто запись, фундаментально иной подход.





Тогда же у Томаса Эдисона возникла идея замысел создать говорящую куклу на основе фонографа, однако практический образец разработал его коллега Уильям Джейкс, запатентовавший в 1888 году миниатюрный воспроизводящий механизм специально для игрушек. Куклу высотой 55 сантиметров выпустила основанная в 1887 году Edison Phonograph Toy Manufacturing Company; внутрь помещался крошечный восковой цилиндр с записью — покупатель мог выбрать из 12 разных стишков длительностью 13–22 секунды.
Записи делали работницы фабрики Эдисона — они должны были громко декламировать детские стишки в фонограф, и эти записи стали первыми в истории коммерческими аудиозаписями, а также самыми ранними известными записями женских голосов в США. Правда, куклы были встречены невероятно холодно, несмотря на «У Мэри был ягнёнок» и «Джек и Джилл». Из 2500 выпущенных кукол продали лишь около 500, а через месяц производство остановили — механизм оказался слишком хрупким, воск легко трескался, а многие дети (и даже взрослые) находили искажённые, «призрачные» голоса куклы откровенно пугающими.
Сегодня сохранившиеся куклы — крайне редкие музейные экспонаты, а Служба национальных парков США оцифровала восемь из известных записей. Послушайте их — некоторые из записей действительно пугают, например, Twinkle, twinkle little star вполне тянет на саундтрек фильма ужасов.
В следующей части мы обязательно расскажем о втором шаге на пути к голосовым помощникам — о распознавании речи. Подписывайтесь на наш блог, чтобы не пропустить следующую статью — и до скорой встречи!









































































