История голосовых помощников, часть II: как распознать звуки, если ты машина
Путь к голосовым помощникам занял в общей сложности три с лишним века. Если предельно упростить этапы, то для создания голосовых помощников нужно было
Научить машины «говорить»,
Научить машины распознавать слова и команды,
Соединить эти умения, добавить понимание смысла и навык выполнения требуемого действия.
В первой части мы уже рассказали, какими были первые машины, которые издавали звуки, слова и целые предложения. Один из наших читателей оставил довольно емкую характеристику в комментариях:
Пристегивайтесь — ныряем в XX век!
Аппарат Мясникова, 1940-е
Во время войны, в 1942, Лев Леонидович Мясников защитил кандидатскую диссертацию «Техническая фонетика» — это была первая в мире работа по объективному распознаванию звуков речи, направлению, которым сейчас занимаются десятки лабораторий мира. Его аппарат умел распознавать гласные — физическим прототипом или его фото порадовать вас не можем, поскольку разработка и демонстрация пришлись на годы блокады Ленинграда, но зато у нас остался патент.
Лев Леонидович прожил долгую жизнь, полную исследований, изобретений (их было, суммарно, 15), книг (их 6, возможно, кто-то из наших читателей даже встречался с ними во время обучения на физфаке) и создал научную школу по судовой акустике и электронике.
Audrey, 1952
Исследователи Bell Labs Стивен Балашек, Р. Биддалф и К. Х. Дэвис создали систему Audrey для распознавания речи. Название расшифровывалось как Automatic Digit Recognizer — автоматический распознаватель цифр.
Выглядело это так:
человек произносил в микрофон, условно, «два»;
Audrey превращала колебания голоса в электрический сигнал;
Audrey смотрела, какие частоты в нём сильнее и как они меняются во времени;
на экране машины появлялась «2».


«Опять двойка»
Может возникнуть вопрос, распознавала ли машина что-то кроме цифр — к сожалению, нет; более того, Audrey работала с изолированными словами (после каждой цифры нужно было сделать заметную паузу). А еще она сильно зависела от диктора, ориентируясь на свою «память» — у одного человека «пять» имеет один звуковой рисунок; у другого — другой. Audrey лучше всего работала с голосом её разработчика Кингсбери Дэвиса: источники приводят точность свыше 90%, а для нескольких других знакомых системе говорящих — примерно 70–80%. Если перед машиной поставить ребенка трех лет, человека с сильным акцентом и пожилого человека с замедленной речью, то результаты распознавания будут куда ниже.
Однако нельзя не признать, что начало было положено — обычно именно Audrey считается первой системой, способной по-настоящему «слушать» человека.
IBM Shoebox, 1962
В 1962 году IBM публично показала на Всемирной выставке в Сиэтле систему Shoebox («обувная коробка»), разработанную Уильямом Дёршем: она понимала 16 английских слов, включая цифры и арифметические команды «плюс», «минус», «итог», позволяя оператору выполнять простые вычисления голосом. Это был первый пример именно голосового управления командами, а не просто распознавания цифр.
Название намекало на то, что прибор небольшой — по сравнению с Audrey это особенно заметно.
Получился первый пример устройства с именно голосовым управлением командами, а не просто распознаванием цифр — сегодня мы можем сказать: «Алиса, сложи два и два» и получить ответ в том числе благодаря тому, что шестьдесят с лишним лет назад была изобретена Shoebox.
Harpy, 1970-е
Гарпия (а именно так переводится название машины, созданной Carnegie Mellon в 1970-х) имела больший лексикон — система работала со словарём из 1011 слов и была рассчитана на конкретные типы запросов, например, на поиск информации в базе данных. Что немаловажно, она умела распознавать не отдельные слова, а связную речь — то есть фразы, произнесённые подряд. Сравните с предыдущими машинами — они были гораздо более чувствительны к паузам и говорящему.
Harpy не понимала речь так гибко, как современные нейросети. Ей заранее давали:
список известных слов;
возможные произношения;
правила, по которым эти слова можно соединять в фразы;
акустические образцы — как примерно должны звучать части речи.
Затем она представляла все допустимые фразы как большую схему с развилками. Услышав голос, система шла по этой схеме и искала маршрут, который лучше всего совпадает со звуком.
Чтобы не проверять сразу сотни вариантов, Harpy сохраняла лишь несколько наиболее правдоподобных догадок на каждом шаге. Этот принцип известен как beam search, или поиск лучом: плохие версии быстро отбрасываются, а вычисления тратятся на перспективные. Именно это сделало систему практически работоспособной при тогдашней вычислительной мощности.
А вот как работает beam search
В одном из испытаний Harpy показывала около 93,77% правильного распознавания слов и около 89,87% правильно распознанных фраз для одного говорящего. В отчётах программы также приводится примерно 3% ошибок по словам и 5% ошибок, меняющих смысл, в задаче со словарём 1 011 слов. Напомним, что все это — в середине 1970-х: не правда ли, впечатляет?
Но при всей грандиозности технического прорыва, выпускать «Гарпию» на волю было рано: это все еще был исследовательский прототип, который не обладал достаточным объемом знаний для встречи с живыми людьми. Зато к августу–сентябрю 1976 года Harpy была настроена на задачу поиска документов в базе данных!
Общение с системой выглядело примерно так:
человек говорил фразу в микрофон — без пауз между отдельными словами;
Harpy сопоставляла звучание с известными ей словами и допустимыми конструкциями фраз;
если фраза была успешно распознана, система могла автоматически сформировать устный ответ; такую возможность демонстрировали уже в феврале 1976 года;
пользователь получал озвученный результат запроса, а не просто строку расшифрованного текста.
Скрытая марковская модель и ее роль в распознавании речи (1980-е, 1990-е)
Скрытая марковская модель, она же CMM (не путать с сммщиками :)) — это способ для компьютера угадывать невидимый процесс по его следам. В распознавании речи она помогает восстановить последовательность звуков и слов по меняющемуся аудиосигналу.
Речь делилась на короткие временные фрагменты, а СММ моделировала вероятности перехода между скрытыми фонетическими состояниями. Сверху работала языковая модель: она оценивала, какая последовательность слов наиболее правдоподобна. В классическом конвейере использовались:
аудио → акустические признаки → СMM → языковая модель → текст
Как это работало
Представьте, что компьютер услышал нечто похожее на: «поставь… бу… дильник… на семь». Шум, дикция и скорость речи делают отдельные участки неоднозначными. СММ может колебаться: это «будильник», «будильники» или вообще другой набор звуков. Но вероятности переходов подсказывают, что после звукового начала «бу-» очень вероятно продолжение «-диль-», а языковая модель добавляет: после слов «поставь» и «на семь» слово «будильник» встречается гораздо правдоподобнее, чем случайная альтернатива, например, «бульон» или «бультерьер». Так акустика и контекст вместе дают итоговую расшифровку.
Мое лицо, когда я пытаюсь расшифровать собственную диктофонную запись лекции. С 1 сентября — во всех ВУЗах страны
Почему это важно для распознавания речи? Потому что это дало возможность отойти от жестких звуковых шаблонов к анализу живой естественной речи. Именно такая архитектура открыла дорогу массовой диктовке, телефонным IVR-меню, голосовому набору. Принцип работы скрытой марковской модели — не делать вид, что машина слышит всё идеально, а выбирать наиболее вероятное объяснение неясного сигнала. Эта идея лежит в основе всей современной вероятностной обработки речи; и пусть сегодня чаще используются нейросети и другие методы, переоценить скрытые марковские модели невозможно.
К слову, с IVR вы наверняка встречаетесь минимум раз в месяц при звонке в банк или ресторан — это интерактивное голосовое меню, то самое, которое предлагает вам нажать 1 для связи с отделом продаж и 2 для соединения с техподдержкой. Узнать о возможностях современного IVR на примере голосового меню MANGO OFFICE и заказать разработку для своего бизнеса можно тут.
DragonDictate
Это одна из ранних коммерческих программ голосовой диктовки для ПК, созданная компанией Dragon Systems. Она превращала произнесённые слова в печатный текст и позволяла управлять компьютером голосом. Первая версия, DragonDictate 30K, вышла в 1990 году с активным словарём около 30 000 английских слов (!!!).
Главное ограничение: нужно было говорить по одному слову с паузами. Например: «Создать… [пауза] новый… [пауза] документ».
Ничего не напоминает? Да, паузы, как и в случае Shoebox, все еще были очень важны, иначе слова «слипались».
Система стоила примерно 9000 долларов (это примерно 23 000 долларов 2026 года по индексу потребительских цен США или три мобильных телефона Motorola MicroTAC), требовала мощного по тем временам ПК с процессором Intel 80386, 8 МБ памяти (не смеяться! Для 1990 года это серьезные цифры), отдельной платы распознавания речи и гарнитуры. Опытный пользователь мог управлять DragonDictate так, что система печатала более 40 слов в минуту.
DragonDictate была важна прежде всего как средство бесклавиатурного ввода: ею пользовались для диктовки документов, а также люди с двигательными ограничениями. В 1997 году её сменила Dragon NaturallySpeaking — программа, которая уже позволяла диктовать фразами в более естественном темпе, без обязательных пауз между словами. Опыт Dragon показал, что голосовой интерфейс нужен не только для телефонного меню IVR и коротких команд, но и для полноценной работы с текстом, а также для управления ПК голосом.
Пройдет еще 20-30 лет с момента создания DragonDictate, и управлять ПК, смартфоном, планшетом, автомобилем при помощи голоса станет обыденностью, а голосовые помощники будут читать сказки детям. Об этом — в одной из наших следующих публикаций!
Подписывайтесь на блог MANGO OFFICE на Пикабу — обещаем, дальше будет еще интереснее :)
Учёные научились удерживать предметы ультразвуком почти в 40 сантиметрах от излучателя — причём только с одной стороны
Заставить маленький предмет висеть в воздухе с помощью звука умеют давно. Но обычно есть одна проблема: объект приходится фактически зажимать звуковым полем между излучателями или работать совсем рядом с источником.
Исследователи из Японии и Великобритании показали другой вариант: предмет стабильно висит почти в 40 сантиметрах от ультразвуковой решётки, хотя звук приходит только снизу.
А в одном из экспериментов между источником и парящим объектом вообще поставили препятствие.
Работа опубликована 24 августа в Physical Review Letters командой из Университета Цукубы, Бристольского университета и Pixie Dust Technologies. Исследователи называют результат первой экспериментальной демонстрацией устойчивой трёхмерной акустической левитации внутри области высокого давления бесселева пучка нулевого порядка.
И вот здесь начинается самое интересное.
Почему обычная акустическая левитация устроена иначе
Звук — это колебания давления в среде. Если создать достаточно интенсивное и правильно организованное ультразвуковое поле, возникающая акустическая сила способна противодействовать гравитации.
Предмет можно заставить буквально висеть в воздухе.
Классическая схема часто использует стоячую волну. В ней появляются устойчивые области, где частицу можно удерживать. Удобно, но геометрия установки сильно ограничивает свободу: нужны встречные волны, отражатель либо объект приходится держать близко к одностороннему излучателю.
С односторонней ловушкой возникает другая неприятность. Чем дальше объект от источника, тем слабее становится удерживающая сила. В какой-то момент поле уже не возвращает частицу к устойчивому положению, а начинает её выталкивать.
Авторы новой работы решили поменять не мощность, а форму самого звукового поля.
Вместо обычного луча — бесселев пучок
В эксперименте использовали ультразвуковую фазированную решётку из 256 излучателей, работающих на частоте 40 кГц. Они создают так называемый бесселев пучок нулевого порядка.
У него есть занятное свойство: центральная область высокой интенсивности остаётся сравнительно узкой на большом расстоянии.
Если совсем грубо представить обычный направленный пучок как луч фонарика, постепенно расширяющийся по мере удаления, то бесселев пучок больше напоминает длинную тонкую структуру с интенсивным центральным «стержнем».
Именно внутри этого стержня исследователи научились удерживать объект.
Причём здесь есть физически необычная деталь.
Во многих традиционных акустических ловушках частица находится около минимума звукового давления.
Здесь её удалось стабильно удерживать непосредственно в центральной области высокого давления бесселева пучка. Именно это авторы называют новым режимом акустической левитации.
Насколько далеко она действительно работает
В основном эксперименте использовался шарик из вспененного полистирола диаметром всего 1,5 мм.
Его удалось стабильно удерживать на расстояниях от 141 до 397 мм от ультразвуковой решётки.
То есть максимальная продемонстрированная дистанция — 39,7 сантиметра, или 46,6 длины волны.
Для сравнения, протестированная авторами обычная односторонняя ловушка работала примерно до 66,7 мм. Поэтому исследователи говорят почти о шестикратном увеличении рабочего расстояния.
Но система умеет не только удерживать шарик.
Авторы показали управляемое перемещение объекта в трёх измерениях, одновременную левитацию нескольких объектов и работу с предметами несферической формы. Среди продемонстрированных образцов были сухой чайный лист и кусочек аэрогеля.
А потом исследователи поставили на пути звука препятствие.
Самый эффектный эксперимент — левитация за препятствием
У бесселевых пучков есть ещё одно интересное свойство, которое называют self-healing — «самовосстановлением».
Название немного обманчиво. Звуковая волна, конечно, не чинит себя и не проходит сквозь непрозрачный объект.
Происходит другое.
Если часть пучка перекрыть, волны, распространяющиеся под углом вокруг препятствия, дальше снова интерферируют и восстанавливают центральную структуру поля.
Поэтому за препятствием опять появляется область, пригодная для удержания частицы.
В эксперименте исследователи действительно продемонстрировали левитацию объекта за физическим препятствием. Это уже интереснее простого рекорда расстояния: манипулятор потенциально получает возможность работать там, где между излучателем и объектом что-то находится.
Но 40 сантиметров — не значит, что завтра ультразвуком будут переносить телефоны
Вот здесь красивый заголовок легко превратить в совсем другую новость.
Исследователи не поднимали предметы обычного бытового размера на расстоянии 40 сантиметров.
Главный тестовый объект — шарик вспененного полистирола диаметром 1,5 мм. Это чрезвычайно лёгкий объект.
Поэтому из эксперимента пока нельзя делать вывод, что технология масштабируется до граммов, десятков граммов или тем более килограммов.
Не показан здесь и готовый промышленный манипулятор.
Речь пока о новом способе формирования акустической ловушки.
Именно возможность увеличить массу удерживаемых объектов, на мой взгляд, теперь становится одним из самых интересных вопросов.
А зачем вообще поднимать что-либо звуком?
Главное достоинство акустической левитации не в красивом трюке.
Это манипуляция без физического контакта.
Представьте материал, которого нежелательно касаться механическим захватом: очень хрупкий образец, вещество, которое нельзя загрязнять поверхностью инструмента, каплю реактива или потенциально опасный материал.
Контактный манипулятор здесь сам становится частью проблемы.
Ультразвуковой — нет.
Авторы поэтому называют среди возможных направлений автоматизацию экспериментов, работу с чувствительными или опасными материалами и объёмные дисплеи. Но это именно потенциальные применения новой физической платформы, а не готовые продукты.
И есть ещё одна любопытная перспектива.
Если объект можно не только удерживать далеко от источника, но и двигать в трёх измерениях, одновременно управлять несколькими частицами и работать за препятствиями, то ультразвуковая решётка постепенно превращается из лабораторного «левитатора» в настоящий бесконтактный манипулятор.
Пока — для очень маленьких и лёгких объектов.
Но ещё недавно именно рабочее расстояние было одним из серьёзных ограничений односторонних систем. Теперь его отодвинули почти до 40 сантиметров.
Что интересно обсудить
Мне здесь любопытнее всего не сама левитация — её демонстрируют уже много лет, — а вопрос масштабирования.
Как думаете, что окажется более жёстким пределом такой технологии: масса предмета, требуемая мощность ультразвука, точность управления или безопасность для окружающей среды?
Если среди пикабушников есть люди, работавшие с ультразвуком и фазированными решётками, особенно интересно услышать практический взгляд.
Первоисточники
Основная работа: Yusuke Koroyasu et al., Midair Single-Sided Acoustic Levitation in High-Pressure Regions of Zero-Order Bessel Beams, Physical Review Letters 137, 094001, опубликована 24 августа 2026 года. Статья открытая, лицензия CC BY 4.0.
Дополнительные материалы и описание установки опубликованы исследовательской группой Университета Цукубы; независимый университетский релиз с пояснениями дал также Бристольский университет.
Напольная или полочная акустика - что выбрать?
Какие колонки звучат лучше – полочные или напольные? Извечный аудиофильский вопрос не имеет ответа и, в принципе, бессмысленнен – так как качество звучания акустических систем определяется не только размерами корпуса, но и типом используемых динамиков, акустическим оформлением, кроссовером и массой других параметров. И определяется взаимодействием АС с вашей комнатой прослушивания - разбираемся с https://www.hifiverse.io/articles/audio/floorstanding-vs-bookshelf-speakers-2026
Три критерия, из которых можно выбрать только два
Закон Хоффмана является фундаментальным правилом, которое известно всем разработчикам громкоговорителей. И он звучит так – чувствительность акустики, нижняя граница АЧХ и объем корпуса спикеров связаны между собой, а улучшить два параметра можно только за счет третьего. Зависимость эта жесткая и нелинейная. Если при неизменной чувствительности вы хотите получить нижнюю границу баса на октаву вниз, объем корпуса колонок должен вырасти примерно в восемь раз. Если объем корпуса АС фиксирован и все равно нужно расширение баса вниз на октаву, вы потеряете почти 9 дБ чувствительности.
Динамическая компрессия, о которой никто не говорит
В процессе работы АС звуковая катушка динамиков нагревается, ее сопротивление растет, как итог, при том же напряжении динамик отдает меньше акустической мощности. Эффект называется термокомпрессией и проявляется на длительном прослушивании на высоком уровне или череде динамических всплесков (БСО, воспроизведение симфоний и т п). У динамика небольшого размера теплоемкость магнитной системы меньше, поэтому и компрессия наступает раньше. Читайте далее https://www.hifiverse.io/articles/audio/floorstanding-vs-bookshelf-speakers-2026
Расстановка акустики – как получить максимум от колонок?
Если мы суммируем влияние правильной расстановки акустики на общее качество звучания системы, то окажется, что этот вклад вполне может даже превысить апгрейд до следующей ценовой категории. Суммарно, на вклад расстановки может прийтись до 20-30% итога – неплохо за пункт, который вам будет стоить ровно ноль? Разбираемся с https://www.hifiverse.io/
ФОРМУЛА РАСЧЕТА МОД ПОМЕЩЕНИЯ
Как уже упоминалось в нашем материале про выбор комнаты прослушивания, между параллельными стенами комнаты прослушивания всегда возникают стоячие волны.
Перемещение акустики или кресла (дивана) – то есть точки прослушивания системы резко меняет положение слушателя относительно всплесков и узлов мод. Никакой другой инструмент в вашем распоряжении не обеспечит столь масштабной коррекции НЧ.
Моды также можно рассчитать в реальном времени используя ПО Dirac и внешний USB-микрофон (далее - https://www.hifiverse.io/articles/audio/speaker-placement-guide-2026 )
Интерференция (SBIR)
Часть излучения (звукового спектра) акустики уйдет назад, отразится от стены и вернется к слушателю с задержкой. На частоте, для которой путь туда и обратно равен половине длины волны, прямой и отражённый сигналы начнут гасить друг друга.
Глубина такого снижения может достигать 6-10 дБ - читайте далее https://www.hifiverse.io/articles/audio/speaker-placement-guide-2026










