История голосовых помощников, часть I: говорящие машины и имитация голоса. От «А» и mama до фонографа
Перед тем, как появились полноценные голосовые помощники — Сири, Кортана, Алекса, Алиса и другие в XXI веке — была проделана гигантская работа, позволившая мечтам стать реальностью.
Которобот, Япония, 1963. Тоже, своего рода, говорящая машина для распугивания мышей, которые быстро привыкли к «чучелу», его сверкающим глазам и мяуканию
Задолго до ИИ, цифровой эры и даже электричества изобретатели начали свой путь к говорящим машинам, которые стали первым серьезным шагом к воплощению проектов полноценных помощников; в XX веке исследователи перешли к другой важной задаче — распознаванию голоса и команд, а уже в цифровую эпоху стало возможным создать первые варианты голосовых ассистентов. Сегодня — о том, как в XVIII веке ученые заставили неживые машины имитировать человеческие голоса.
Перед прочтением скромно напомним, кто мы: MANGO OFFICE, лидер IP-телефонии и виртуальных АТС в России по версии CNews (2021-2024), разработчик 200+ функций для бизнес-коммуникаций. А еще у нас есть Голосовые роботы — в отличие от героев сегодняшней статьи, они самостоятельные, современные, умеют поддерживать разговор и не пугают собеседника потусторонним тоном☺
Дед Чарльза Дарвина
Где-то в 1771 году Эразм Дарвин, врач по специальности и изобретатель в душе, построил свою говорящую машину — раньше, чем другие герои этой статьи, независимо от их ранних разработок. Что интересно, это произошло из-за азарта Эразма — промышленник Мэттью Болтон, друг Дарвина и участник знаменитого Лунного общества (Lunar Society), заключил с ним пари на 1000 фунтов — колоссальную по тем временам сумму — что тот не сможет построить инструмент, способный произносить «Отче наш», Символ веры и Десять заповедей на английском языке. Формальная письменная расписка от 3 сентября 1777 года сохранилась до наших дней и подтверждает условия ставки.


Эразм (1) и Чарльз (2) Дарвины
Эразм описал получившееся (и не дошедшее до нас) устройство сам. Машина представляла собой деревянный рот с губами из мягкой кожи, а с задней стороны — клапан, имитирующий носовые полости; оба элемента быстро открывались и закрывались нажатием пальцев. «Голосовой» звук создавала шёлковая лента длиной около 2,5 см и 6 мм шириной, натянутая между двумя кусочками слегка вогнутого гладкого дерева: когда лёгкий поток воздуха от мехов обдувал край ленты, она вибрировала между деревянными сторонами, издавая приятный тон, напоминающий человеческий голос. По собственным словам Дарвина, для расширения возможностей машины требовалось не более 13 движений, которые теоретически можно было бы связать с клавишами клавесина или фортепиано.
Christophe Veaux of Edinburgh University (реконструкция с 42 секунды)
Машина умела произносить mama, papa, map и pam, но до «Отче наш» и десяти заповедей было еще далеко, а с набором из p, b, m и a далеко не уйдешь. Поэтому пари он все-таки проиграл и 1000 фунтов не получил (сегодня это были бы 272 000 долларов). Интересна позиция самого Эразма — он себя позиционировал в первую очередь как врач, поэтому «побочные квесты» занимали меньше его внимания и времени, чем хотелось бы.
5 звуков Христиана Кратценштейна
В 1779 году датчанин Христиан Кратценштейн, действительный член Российской академии наук, создал модель речевого тракта — она могла произносить 5 гласных звуков при помощи вибрирующих язычков, задеваемых воздушным потоком.
К сожалению, само устройство до нас не дошло, но по описаниям его смогли восстановить — реконструкция выглядит вот так:
Реконструкция выполнена Serge Durin, за что мы очень ему благодарны
Славься, король: лесть аббата Микаля
Аббат Микаль в 1783 году представил королю свое собственное изобретение — говорящие головы на роликовом приводе, которые могли произносить заранее определенное количество фраз, имитируя человеческий голос. Несмотря на то, что имитация была весьма несовершенной, изобретение было новаторским, что было признано Академией наук.
Управление осуществлялось двумя разными клавиатурами: одна была связана с цилиндром (как в музыкальной шкатулке) и позволяла произносить лишь фиксированный набор фраз, но с правильно расставленными паузами между словами и правильной просодией; вторая клавиатура давала доступ ко всем звукам французского языка, сведённым изобретателем к небольшому числу комбинаций, и теоретически позволяла «набирать» пальцами любую фразу — как на пишущей машинке.
Финансовой поддержки, правда, Микаль не получил — и остался должен скульптору, который изготовил головы. К сожалению, до нас дошли только очень скудные описания устройства, которое, тем не менее, считается первым заранее программируемым голосовым симулятором некоторыми историками.
Странно, что Людовик XVI не смилостивился и не проспонсировал аббата — головы вели буквально следующий диалог (на французском):
— Король дарует Европе мир.
— Мир венчает короля славой.
— И мир делает народ счастливым.
— О обожаемый король, отец своего народа, их счастье являет Европе славу твоего трона.
Правда, комиссия, которой демонстрировалось изобретение, и не включала короля. Возьмем на себя дерзость предположить, что на фоне другого объекта оценки той же комиссии 1783 года — полет монгольфьера — невнятно говорящие головы действительно меркли.
20 лет разработки Вольфганга фон Кемпелена
Параллельно с Кратценштейном Вольфганг фон Кемпелен, венгеро-австрийский изобретатель, разрабатывал свою говорящую машину. Потратив 20 с лишним лет, в 1791 году он представил свое произведение инженерной мысли — с сегментами, функционально имитирующими рот, голосовые связки, легкие для забора воздуха и нос для носовых согласных (если любопытно, можно увидеть первоисточник тут). В первой версии роль легких взяли на себя кухонные меха, а само оно издавало только гласные.
Чертеж деталей говорящей машины 1791 года. Мехи действуют как легкие, подавая воздух в голосовую камеру, где находится вибрирующая язычковая мембрана. Звуки образуются за счет клапанов.
Интонацию эта машина не передавала, но издавать звуки и целые слова вполне могла — особенно легко ей давались латынь, французский или итальянский, а вот о немецкий устройство спотыкалось из-за нагромождения согласных.
Реконструкция Alexander Steinbeißer. Не ищите внешнее сходство с человеческим речевым аппаратом — оригинал тоже выглядел весьма не антропоморфно, судя по чертежам
Кстати, вы вполне могли слышать о Вольфганге фон Кемпелене раньше — это он придумал шахматный аппарат «Механический турок», снаружи которого была восковая фигура усача в экзотическом наряде, а внутри — сидел сильный шахматист. Видел доску он благодаря системе зеркал.
К сожалению, оригинал почил в XIX веке при пожаре в музее Филадельфии, но вот наиболее близкая реплика
Кемпелен катался со своим механическим детищем по Европе, давая туры, а после его смерти достался инженеру Мельцелю, при котором и играл с Наполеоном в 1809 году. Только в 1834 году шахматист Муре, один из живых «резидентов» механического турка, раскрыл секрет автомата, опубликовав статью в журнале, а в 1836 году об этом написал эссе Эдгар По (тот самый, вот перевод на русский). Впрочем, Мельцель даже после разоблачения кататься с гастролями не перестал…
XIX век представляет
Если XVIII и первая половина XIX века пытались буквально воссоздать анатомию речи (гортань, язык, губы), то вторая половина XIX века нашла обходной путь — фиксацию и повторное воспроизведение уже существующего звука.
Йозеф Фабер превзошел по «долгострою» даже Кемпелена — он потратил около 25 лет на Euphonia, что с греческого можно перевести как «красиво звучащая». Euphonia, она же Евфония, была представлена в 1845 году, хотя первую версию он презентовал пятью годами ранее — тогда же Йозеф и уничтожил свое «черновое» изобретение, разочаровавшись в результате. По легенде, Фаберу потребовалось семь лет только на то, чтобы добиться правильного произношения звука [e].
Конструкция была самой сложной среди всех говорящих машин своего времени: механическая копия человеческого горла и голосовых органов приводилась в движение клавиатурой из 16–17 клавиш, как у фортепиано, а меха под ножной педалью выполняли роль лёгких. Искусственная гортань была сделана из резины с подвижной голосовой щелью из тонких пластинок слоновой кости для регулировки натяжения, верхняя челюсть с кожаной губой оставалась неподвижной, а нижняя из гуттаперчи двигалась; язык, тоже резиновый, мог прижиматься к нёбу или отводиться назад к горлу. Заметьте, как имитирует строение человеческого речевого аппарата Евфония — у предыдущих машин «языка» и «губ» не было.


Иногда Эвфония выставлялась не только с женской маской (1), закрывавшей механический рот, язык и челюсть, но и с платьем. 2: Рисунок из The London Journal, 1870
Евфония могла говорить на английском, французском и немецком — правда, во всех языках с заметным немецким акцентом, поскольку оператором обычно выступала жена изобретателя, госпожа Фабер, немка по происхождению — судя по всему, фрау и машину заставляла звучать близко к своему родному языку.
Машина была наиболее продвинутой среди перечисленных нами — умела петь, включая исполнение гимна «God Save the Queen», на демонстрациях произносила вступительную фразу: «Простите за медленное произношение… Доброе утро, дамы и господа… Сегодня тёплый день… Сегодня дождливый день…». Несмотря на техническое совершенство, публика находила голос машины пугающим, «загробным» и монотонным — коммерческого успеха «Евфония» так и не добилась.
Записывай, а не имитируй: кукла Эдисона
В 1877 году, когда Томас Эдисон работал над телеграфом и телефоном, он попутно изобрёл фонограф — устройство фиксировало звуковые колебания через мембрану с иглой на вращающемся цилиндре, обёрнутом оловянной фольгой. Проверяя изобретение, Эдисон продекламировал в микрофон детский стишок «У Мэри был ягнёнок» и, к своему изумлению, услышал воспроизведённые собственные слова. Это уже не было синтезом речи в духе Кемпелена или Фабера — фонограф записывал и воспроизводил реальный голос, минуя всю проблему механической имитации артикуляции. Никаких попыток имитировать человеческие легкие, рот и голосовые связки — просто запись, фундаментально иной подход.





Тогда же у Томаса Эдисона возникла идея замысел создать говорящую куклу на основе фонографа, однако практический образец разработал его коллега Уильям Джейкс, запатентовавший в 1888 году миниатюрный воспроизводящий механизм специально для игрушек. Куклу высотой 55 сантиметров выпустила основанная в 1887 году Edison Phonograph Toy Manufacturing Company; внутрь помещался крошечный восковой цилиндр с записью — покупатель мог выбрать из 12 разных стишков длительностью 13–22 секунды.
Записи делали работницы фабрики Эдисона — они должны были громко декламировать детские стишки в фонограф, и эти записи стали первыми в истории коммерческими аудиозаписями, а также самыми ранними известными записями женских голосов в США. Правда, куклы были встречены невероятно холодно, несмотря на «У Мэри был ягнёнок» и «Джек и Джилл». Из 2500 выпущенных кукол продали лишь около 500, а через месяц производство остановили — механизм оказался слишком хрупким, воск легко трескался, а многие дети (и даже взрослые) находили искажённые, «призрачные» голоса куклы откровенно пугающими.
Сегодня сохранившиеся куклы — крайне редкие музейные экспонаты, а Служба национальных парков США оцифровала восемь из известных записей. Послушайте их — некоторые из записей действительно пугают, например, Twinkle, twinkle little star вполне тянет на саундтрек фильма ужасов.
В следующей части мы обязательно расскажем о втором шаге на пути к голосовым помощникам — о распознавании речи. Подписывайтесь на наш блог, чтобы не пропустить следующую статью — и до скорой встречи!
Обзор китайской подделки микшера Behringer Xenyx X1832USB
Год назад купил китайскую подделку микшерного пульта Behringer Xenyx 1832 за 9100р на озон. Я знал что брал и оригинал столько стоить не может. Это был чистый эксперимент. Сразу скажу: после первоначального тестирования я им особо не пользовался. Один раз только давал, чтобы на улице мероприятие для мелких провести. В общем-то, он так и лежит в закромах.
За эту цену — вполне качественная имитация. Встроенные эффекты работают отлично, и в плане регулировки этот пульт мне понравился даже больше оригинала. Во-первых, у него шире диапазон (больше ступеней) регулировки самого эффекта. Во-вторых, уровень выхода здесь значительно выше. Если на оригинальном Behringer при нуле децибел и среднем положении посыла на канале эффект едва слышно (приходится задирать или посыл, или возврат), то здесь эффект слышно четко и сразу, а снизить его громкость не проблема. Всё остальное тоже работает без нареканий.
Естественно, сразу же препарировал прибор. Пайка качественная. Перемычки на фото пусть вас не смущают: это вполне нормальное явление даже на технике именитых брендов при доводке модели до серии. Иногда так оказывается дешевле и качественнее, чем переделывать и менять всю плату.
Из минусов: на многих переключателях слышны щелчки при нажатии, особенно это заметно при переключении источника на монитор. Конечно, на хорошем микшере такого быть не должно. Но для любительских задач это не критично. В остальном проверил все функции — всё работает, причём работает неплохо.
В компьютере пульт определяется как обычная китайская звуковая плата. Оригинал определяется как устройство на Burr-Brown (американский бренд, выкупленный Texas Instruments). У китайца за оцифровку отвечает АЦП, выдающий 16 бит / 48 кГц. В целом USB-интерфейс у копии работает без нареканий. Профессиональным музыкантам я бы такой аппарат не посоветовал.
Что по звуку: сразу скажу, приборами замеры не делал. Слушал на мониторах KRK Rokit 5 Generation 2. На высоких частотах звук подмыливает, но это не критично для тех, кто привык к бытовому Hi-Fi. «Пыс-пыс» услышите хорошо :))). К низким частотам претензий нет.
По сравнению с «породистыми» англичанами, американцами и немцами, в целом звук от инструментов получается плоским, не выразительным. Атака хромает. Но ухо не режет. Помимо своих инструментов, запустил через пульт транзитом качественный источник — альбом Pink Floyd «The Dark Side of the Moon». При том что верха чуть-чуть занижает и размывает, в целом стереокартинка не потерялась. То есть фазовые искажения на линиях без эквалайзеров небольшие или вовсе отсутствуют.
Корпус изготовлен качественно и внешне на 100% повторяет оригинал — все кнопки, фейдеры и регуляторы на своих местах. Там где нужно — стоит металл, где нужно — пластик, на материалах явно не экономили.
На фото видно графический эквалайзер с подсветкой ручек. Система обнаружения обратной связи (FBQ). Ручка соответствующей частоты начинает мигать, если микрофон ловит обратную связь через колонки. Проверил - работает.
Инструкция без русского языка. Но достаточно подробная,есть всё.
Начинающим брать однозначно. Отличная возможность освоить приёмы работы с полупрофессиональной техникой за небольшие деньги. А если купить такой пульт ребёнку или школьнику, который осваивает игру на электрогитаре, то его счастью не будет предела. Это стопроцентно имитация полупрофессионального оборудования.
Рекомендую однозначно.
Ссылку на карточку товара давать не буду, дабы это не сочли за рекламу. Но эти реплики сейчас не продаёт только ленивый. Цена, правда, поднялась примерно на 1 500 рублей за год, но ценовую категорию это не меняет.
Как купить High-End наушники за 7 000 руб?
В прошлых обсуждениях в комментариях коллеги спрашивали о технологичных решениях, которые приходят в относительно недорогой сегмент из High-End области. Вот наглядный пример – планарные наушники.
Лет пятнадцать назад это был супер-пупер хай энд по цене в 500 000 руб. и это еще не предел. Сегодня на Яндекс Маркете такие наушники находимы за 7 000 руб - мы подробно разобрали тот сектор в рейтинге https://www.hifiverse.io/articles/audio/top-7-planar-magnetic-headphones-2026
Как такое произошло? HiFiMan разработал StealthMagnet и Asymmetric Magnetic Circuit, Audeze создал Fluxor, Dan Clark Audio - AMTS и V-Planar, а все это вместе решило большинство проблем планеров и сделало технологию действительно массовой и недорогой.
Да, планарные наушники пока почти вдвое тяжелее, чем их динамические собратья, требуют более мощного усиления и, как правило, используют открытую конструкцию (шумоподавление в данном случае будет менее эффективно). На обратной стороне медали – выдающееся разрешение и очень быстрый звук.
Все дело в конструкции – динамический драйвер использует катушку на конусе диффузора, она движется в магнитном поле, отсюда и звук. В планарной магнитной системе применяется пленка толщиной в несколько микрон с уже напечатанными на ней электрическими дорожками и двумя массивами магнитов. В итоге, когда сигнал поступает на дорожки, вся поверхность излучателя движется в магнитном поле – такой подход обеспечивает заметно более низкие нелинейные искажения, а меньшая масса излучателя гарантирует меньшую инерцию и более быстрый отклик.
На какие планарные модели сегодня стоит обратить внимание?
Выбираем с https://www.hifiverse.io/
HiFiMan HE400se – от 7 000 руб.
HiFiMan HE400se – одни из самых доступных планарных наушников на сегодня. Модель использует фирменную инновацию – систему StealthMagnet, переориентированную магнитную конструкцию для прохождения звуковых волн через массив с минимальной дифракцией. 88 мм излучатели с поляризованной пленкой, 25 Ом импеданса и 91 дБ чувствительности – ТТХ соответствуют крепкому середнячку.
HiFiMan Sundara – 12 000 за закрытую версию и от 24 000 руб. за открытую
Шаг вверх по модельному ряду HiFiMan – и вот у нас в руках наушники HiFiMan Sundara. Пережившая несколько апгрейдов после релиза в 2018 году модель является одной из знаковых для рынка (особенно после снижения прайса) – использование диафрагмы на 80% тоньше, чем у HE400se и 105 мм излучателей позволило обеспечить лучшее разрешение. Чувствительность тоже выросла – до 94 дБ при импедансе в 37 Ом.
Audeze LCD-1 – от 35 000 руб.
Audeze LCD-1 – 90 мм фирменный изучатель с технологией Uniforce (комбинацией дороже различной ширины) и магнитной системой Fluxor работает исключительно хорошо – а вместе импедансом в 16 Ом и чувствительностью в 99 дБ Audeze LCD-1 становятся одними из самых «всеядных» по части усиления моделей.
И еще много статей о хорошем звуке https://www.hifiverse.io/articles/
И немного фото с выставки просто так
А вы помните аудиокассеты, обработанные дома магнитом?
Что-то в этом было. Кто не знает, что при таких опытах получается, объясняю - уровень громкости на кассете падает до нуля, затем возвращается на прежний уровень и так на протяжении всей кассеты, испорченной ее части.
Пианино на адруино. Часть 1
Самые интересные проекты рождаются на стыке нескольких сфер (с) мой преподаватель из универа.
Однажды я увидел на ютубе замечательный номер, которым восхищен и по сей день.
Video bouncing ball piano - 1
Video bouncing ball piano - 2
Эта идея была на уровне мечтаний и долго пылилась в ящике, но совсем недавно наткнулся на нечто похожее в инстаграм (*запрещен на территории РФ)
видео 3:
видео 4:
Жонглировать я умею, и умею немного программировать. Поэтому решил изучить вопрос создания сего девайса или хотя бы прототипа.
Я связался с автором видео. Он из Чили и общаться с ним весьма сложно, т.к. анлийского он не знает. Но он был так добр, что скинул мне список оборудования, распиновку, 2 схемы и даже код на гитхабе.
На первый взгляд это устройство вроде самодельного музыкального синтезатора. Проблема в том что я никак не связан со схемотехникой и adruino в частности, поэтому не очень понимаю отличие плат, резисторов и пр. Но если проект разделить на небольшие части и последовательно все собрать может чтото и выйдет. поэтому нуждаюсь пока в опытном взгляде. Может кто волокет за adruino и кому не в лом подсказать зачем нужна каждая деталь (если дал не правильные пояснения). Также хочу составил список по оборудованию для заказа с Ozon, подойдёт ли оно и комментарии (далее прилагаю название оборудования на испанском с переводом и моими размышлениями) :
I saw your list of materials, but it’s not entirely correct; Arduino is not used. I’ll make a materials list for you:
1) ESP32 (30 pins)
*тут все понятно. мозги проекта, главный контроллер (но на озоне очень много вариантов по запросу ESP32 . И не понятно какая зачем)
2) MPU6050
*хз зачем тут. вроде как отвечает за положение в пространстве, но вся конструкция будет статична.
3) 4 potentiometers, 1k ohms
предполагаю что это 4 потенциометра по 1 кОм
*для настройки параметров пианино (громкость, октава, эффекты и т.д.)
4) 6 resistors, 220 ohms
6 резисторов по 220 Ом
*нужны для ограничения тока через 4 светодиода и 2 компонента MIDI-выхода / аудиоцепи
5) 4 resistors, 1M
Резисторы 1 МОм
*Внешняя подтяжка (pull-up) для 4 кнопок (хуй знает что это такое)
6) 2 resistors, 1k
2 Резистора 1 кОм
MIDI-выход — для ограничения тока в MIDI-петле
Аудиовыход или защита — для фильтрации PWM-сигнала или защиты пина ESP32
7) 4 push buttons
тактовая кнопка
8) 4 LEDs
какая их функция не понятно
9) MIDI board connector
*Это гнездо которое впаивается в корпус синтезатора. В него ты втыкать MIDI-кабель, идущий к компьютеру (но я та копнимаю отсюда мне надо тольуо одно гнездо черное, оно же интерфейс)
10) Headphone jack
гнездо для джека на выбор несколько вариантов. предполагаю тот что с ножками подойдет.
11) MAX4466 microphone sensor
микрофонный модуль будет принимать звук отскакивания мячиков
12) 1 µF capacitor
Конденсатор 1мкФ на сколько вольт???
*разделительный конденсатор — убирает постоянную составляющую сигнала, чтобы на наушники не подавалось постоянное напряжение (это может повредить наушники или дать постоянный щелчок)
13) 103 capacitor
Керамический конденсатор0.01 µF (103)
так и не разобрался для чего он. тут нужна помощь
ну и Макетная плата❓, Провода dupont набор❓
В общем это пока все. Подскажите возможно ли это собрать и чтонибудь посоветуйте. Всем добра ✌️
































