История голосовых помощников, часть II: как распознать звуки, если ты машина
Путь к голосовым помощникам занял в общей сложности три с лишним века. Если предельно упростить этапы, то для создания голосовых помощников нужно было
Научить машины «говорить»,
Научить машины распознавать слова и команды,
Соединить эти умения, добавить понимание смысла и навык выполнения требуемого действия.
В первой части мы уже рассказали, какими были первые машины, которые издавали звуки, слова и целые предложения. Один из наших читателей оставил довольно емкую характеристику в комментариях:
Пристегивайтесь — ныряем в XX век!
Аппарат Мясникова, 1940-е
Во время войны, в 1942, Лев Леонидович Мясников защитил кандидатскую диссертацию «Техническая фонетика» — это была первая в мире работа по объективному распознаванию звуков речи, направлению, которым сейчас занимаются десятки лабораторий мира. Его аппарат умел распознавать гласные — физическим прототипом или его фото порадовать вас не можем, поскольку разработка и демонстрация пришлись на годы блокады Ленинграда, но зато у нас остался патент.
Лев Леонидович прожил долгую жизнь, полную исследований, изобретений (их было, суммарно, 15), книг (их 6, возможно, кто-то из наших читателей даже встречался с ними во время обучения на физфаке) и создал научную школу по судовой акустике и электронике.
Audrey, 1952
Исследователи Bell Labs Стивен Балашек, Р. Биддалф и К. Х. Дэвис создали систему Audrey для распознавания речи. Название расшифровывалось как Automatic Digit Recognizer — автоматический распознаватель цифр.
Выглядело это так:
человек произносил в микрофон, условно, «два»;
Audrey превращала колебания голоса в электрический сигнал;
Audrey смотрела, какие частоты в нём сильнее и как они меняются во времени;
на экране машины появлялась «2».


«Опять двойка»
Может возникнуть вопрос, распознавала ли машина что-то кроме цифр — к сожалению, нет; более того, Audrey работала с изолированными словами (после каждой цифры нужно было сделать заметную паузу). А еще она сильно зависела от диктора, ориентируясь на свою «память» — у одного человека «пять» имеет один звуковой рисунок; у другого — другой. Audrey лучше всего работала с голосом её разработчика Кингсбери Дэвиса: источники приводят точность свыше 90%, а для нескольких других знакомых системе говорящих — примерно 70–80%. Если перед машиной поставить ребенка трех лет, человека с сильным акцентом и пожилого человека с замедленной речью, то результаты распознавания будут куда ниже.
Однако нельзя не признать, что начало было положено — обычно именно Audrey считается первой системой, способной по-настоящему «слушать» человека.
IBM Shoebox, 1962
В 1962 году IBM публично показала на Всемирной выставке в Сиэтле систему Shoebox («обувная коробка»), разработанную Уильямом Дёршем: она понимала 16 английских слов, включая цифры и арифметические команды «плюс», «минус», «итог», позволяя оператору выполнять простые вычисления голосом. Это был первый пример именно голосового управления командами, а не просто распознавания цифр.
Название намекало на то, что прибор небольшой — по сравнению с Audrey это особенно заметно.
Получился первый пример устройства с именно голосовым управлением командами, а не просто распознаванием цифр — сегодня мы можем сказать: «Алиса, сложи два и два» и получить ответ в том числе благодаря тому, что шестьдесят с лишним лет назад была изобретена Shoebox.
Harpy, 1970-е
Гарпия (а именно так переводится название машины, созданной Carnegie Mellon в 1970-х) имела больший лексикон — система работала со словарём из 1011 слов и была рассчитана на конкретные типы запросов, например, на поиск информации в базе данных. Что немаловажно, она умела распознавать не отдельные слова, а связную речь — то есть фразы, произнесённые подряд. Сравните с предыдущими машинами — они были гораздо более чувствительны к паузам и говорящему.
Harpy не понимала речь так гибко, как современные нейросети. Ей заранее давали:
список известных слов;
возможные произношения;
правила, по которым эти слова можно соединять в фразы;
акустические образцы — как примерно должны звучать части речи.
Затем она представляла все допустимые фразы как большую схему с развилками. Услышав голос, система шла по этой схеме и искала маршрут, который лучше всего совпадает со звуком.
Чтобы не проверять сразу сотни вариантов, Harpy сохраняла лишь несколько наиболее правдоподобных догадок на каждом шаге. Этот принцип известен как beam search, или поиск лучом: плохие версии быстро отбрасываются, а вычисления тратятся на перспективные. Именно это сделало систему практически работоспособной при тогдашней вычислительной мощности.
А вот как работает beam search
В одном из испытаний Harpy показывала около 93,77% правильного распознавания слов и около 89,87% правильно распознанных фраз для одного говорящего. В отчётах программы также приводится примерно 3% ошибок по словам и 5% ошибок, меняющих смысл, в задаче со словарём 1 011 слов. Напомним, что все это — в середине 1970-х: не правда ли, впечатляет?
Но при всей грандиозности технического прорыва, выпускать «Гарпию» на волю было рано: это все еще был исследовательский прототип, который не обладал достаточным объемом знаний для встречи с живыми людьми. Зато к августу–сентябрю 1976 года Harpy была настроена на задачу поиска документов в базе данных!
Общение с системой выглядело примерно так:
человек говорил фразу в микрофон — без пауз между отдельными словами;
Harpy сопоставляла звучание с известными ей словами и допустимыми конструкциями фраз;
если фраза была успешно распознана, система могла автоматически сформировать устный ответ; такую возможность демонстрировали уже в феврале 1976 года;
пользователь получал озвученный результат запроса, а не просто строку расшифрованного текста.
Скрытая марковская модель и ее роль в распознавании речи (1980-е, 1990-е)
Скрытая марковская модель, она же CMM (не путать с сммщиками :)) — это способ для компьютера угадывать невидимый процесс по его следам. В распознавании речи она помогает восстановить последовательность звуков и слов по меняющемуся аудиосигналу.
Речь делилась на короткие временные фрагменты, а СММ моделировала вероятности перехода между скрытыми фонетическими состояниями. Сверху работала языковая модель: она оценивала, какая последовательность слов наиболее правдоподобна. В классическом конвейере использовались:
аудио → акустические признаки → СMM → языковая модель → текст
Как это работало
Представьте, что компьютер услышал нечто похожее на: «поставь… бу… дильник… на семь». Шум, дикция и скорость речи делают отдельные участки неоднозначными. СММ может колебаться: это «будильник», «будильники» или вообще другой набор звуков. Но вероятности переходов подсказывают, что после звукового начала «бу-» очень вероятно продолжение «-диль-», а языковая модель добавляет: после слов «поставь» и «на семь» слово «будильник» встречается гораздо правдоподобнее, чем случайная альтернатива, например, «бульон» или «бультерьер». Так акустика и контекст вместе дают итоговую расшифровку.
Мое лицо, когда я пытаюсь расшифровать собственную диктофонную запись лекции. С 1 сентября — во всех ВУЗах страны
Почему это важно для распознавания речи? Потому что это дало возможность отойти от жестких звуковых шаблонов к анализу живой естественной речи. Именно такая архитектура открыла дорогу массовой диктовке, телефонным IVR-меню, голосовому набору. Принцип работы скрытой марковской модели — не делать вид, что машина слышит всё идеально, а выбирать наиболее вероятное объяснение неясного сигнала. Эта идея лежит в основе всей современной вероятностной обработки речи; и пусть сегодня чаще используются нейросети и другие методы, переоценить скрытые марковские модели невозможно.
К слову, с IVR вы наверняка встречаетесь минимум раз в месяц при звонке в банк или ресторан — это интерактивное голосовое меню, то самое, которое предлагает вам нажать 1 для связи с отделом продаж и 2 для соединения с техподдержкой. Узнать о возможностях современного IVR на примере голосового меню MANGO OFFICE и заказать разработку для своего бизнеса можно тут.
DragonDictate
Это одна из ранних коммерческих программ голосовой диктовки для ПК, созданная компанией Dragon Systems. Она превращала произнесённые слова в печатный текст и позволяла управлять компьютером голосом. Первая версия, DragonDictate 30K, вышла в 1990 году с активным словарём около 30 000 английских слов (!!!).
Главное ограничение: нужно было говорить по одному слову с паузами. Например: «Создать… [пауза] новый… [пауза] документ».
Ничего не напоминает? Да, паузы, как и в случае Shoebox, все еще были очень важны, иначе слова «слипались».
Система стоила примерно 9000 долларов (это примерно 23 000 долларов 2026 года по индексу потребительских цен США или три мобильных телефона Motorola MicroTAC), требовала мощного по тем временам ПК с процессором Intel 80386, 8 МБ памяти (не смеяться! Для 1990 года это серьезные цифры), отдельной платы распознавания речи и гарнитуры. Опытный пользователь мог управлять DragonDictate так, что система печатала более 40 слов в минуту.
DragonDictate была важна прежде всего как средство бесклавиатурного ввода: ею пользовались для диктовки документов, а также люди с двигательными ограничениями. В 1997 году её сменила Dragon NaturallySpeaking — программа, которая уже позволяла диктовать фразами в более естественном темпе, без обязательных пауз между словами. Опыт Dragon показал, что голосовой интерфейс нужен не только для телефонного меню IVR и коротких команд, но и для полноценной работы с текстом, а также для управления ПК голосом.
Пройдет еще 20-30 лет с момента создания DragonDictate, и управлять ПК, смартфоном, планшетом, автомобилем при помощи голоса станет обыденностью, а голосовые помощники будут читать сказки детям. Об этом — в одной из наших следующих публикаций!
Подписывайтесь на блог MANGO OFFICE на Пикабу — обещаем, дальше будет еще интереснее :)
Ответ на пост «Желание драмы»1
Продюсирование отраслевых разговорных шоу в мире интернет-андерграунда (не путать с "нижним фрик-интернетом") в реалиях 2026 года это ещё не совсем мэйнстрим. Даже если бегло ознакомиться с метаниями РКН по этой теме, где государство обеспокоено не только потерей действительных рычагов общественной безопасности (корневая часть "вековечной непрекращающейся" проблемы гражданина и государства), но и статусных рычагов авторитарных функционеров мира "большого брата" (директор? да пошёл ты в жопу, директор!), то станет ясно, что очень нас мало и страшно далеки мы от народа (в смысле что нерешённая для случая цифрового концлагеря "задача византийских генералов").
Здесь уместно процитировать по причине бессмысленности неопубликованный накануне этого текста выпуск-ответ на инициированное обсуждение преемственности культуры программирования компьютерных игр из полуфабрикатов.
Вот оно: Среда разработки "Кенгуренок" (среда разработки "Кенгурёнок" и антропологически изолированная проблематика цеховой философии "РЯП ИИ" на примере гипотетической java-диалектной реализации ЯВУ "Опричник").
Компьютерные игры и постсоветская социально-политическая повестка в диалоге культурного пространства? Как и всё остальное делится на "ради денег" и "ради славы". Обратите внимание, что атрибуты славы определяют тоже через общественную повестку, тогда как работать на благо экосистемы не является рациональным экономическим поведением. Без разницы, через служение науке или служение искусству – итогом всегда является безблагодатность.
Моя соименница Дарья "Елизавета" Островская, когда не подрабатывает на досуге торговлей мобилками в интернете, немало пишет говорить красивых слов о необходимости культивации независимых разработчиков видеоигр. Это полная копия прошедших аналогичных процессов книгоиздательского мира, однако подрощенных независимых разработчиков ввергают в корпоративную зависимость чуть более охотно, нежели произведённых на сегодня с избытком писарей.
Компьютерные игры и постсоветская социально-политическая повестка в диалоге культурного пространства? Исключить из модели мотивации разработчиков внекорпоративного сектора статью дохода за счёт непосредственного сбыта произведённой медиапродукции.
Итак, плавное вхождение в режим продюсера компьютерных видеоигр исторического периода СНГ-войны за независимость от деструктивной художественной, коммерческой, политической и социальной повестки. Люди с атрофированной личностной жизненной позицией на условно централизованный художественный совет (вся власть Советам, разумеется) не приглашаются, т.к. им не надо.
Принятие решения о том, относится ли данный стиль диалектики к тематике сообщества разработчиков видеоигр или же игнорирование контекста это должен быть ключевой базис мировоззрения креативной интеллигенции – на усмотрение администрации. Денег купить 50 миллионов просмотров нет.
Forbes анонсировал появление нового участника российского списка миллиардеров
ИИ-стартап Higgsfield, сооснователем которого является россиянин Александр Машрабов, после раунда инвестиций оценили в $5,4 млрд. Доля Машрабова, по оценкам, может превышать 20%, и он может попасть в рейтинг Forbes
Сооснователь американского ИИ-стартапа Higgsfield Александр Машрабов может пополнить российский рейтинг миллиардеров по версии Forbes, пишет издание.
Его доля в компании, которую по итогам последнего раунда инвестиций оценили в $5,4 млрд, может превышать 20%, рассказал Forbes источник, близкий к сделке.
Компания Higgsfield, специализирующаяся на генерации видеоконтента с помощью искусственного интеллекта, недавно привлекла $400 млн. Инвесторами выступили Intel, Goldman Sachs, DST Global, Liberty Global и другие. Для сравнения: еще в начале 2026 года стартап стоил $1,3 млрд, тогда проект получил $80 млн инвестиций.
По данным финтех-платформы Carta, на которые ссылается издание, у команды стартапа после венчурного финансирования в среднем осталось около 23% бизнеса, однако есть вероятность, что доля основателей Higgsfield осталась выше обычного по сравнению с аналогичными сделками. Эксперты полагают, что доля Машрабова составляет от 25 до 30%. Сооснователь The Garage Syndicate Сергей Мосунов оценивает часть капитала создателей Higgsfield в $3 млрд, $2 млрд из которых у Машрабова.
Higgsfield был основан в 2023 году Машрабовым и казахстанским исследователем в области машинного обучения Ерзатом Дулатом. Стартап разрабатывает платформу для генерации и редактирования видео и изображений с помощью нейросетей. В августе 2026-го, как пишет Financial Times, годовая выручка Higgsfield достигла $700 млн против $20 млн годом ранее.
Машрабов окончил МФТИ по направлению «Информатика», во время учебы работал в «Яндексе» инженером по машинному обучению, развивал «Поиск». В 2018-м вместе с Григорием Ткаченко запустил AI Factory — платформу по анимации фото и видео с помощью ИИ. В январе 2020 года американская Snap Inc. (создатель Snapchat) купила стартап за $166 млн. Машрабов перешел в Snap, где возглавил отдел генеративного ИИ, и проработал там до запуска Higgsfield осенью 2023 года.
В 2020-м предприниматель попал в российский рейтинг Forbes «30 до 30» в категории «Наука и технологии».
Как собрать идеальный процессор из математического LEGO: Объясняем теорию ENIGMA без высшей математики
Если вы хоть раз открывали современные статьи по теоретической информатике или теории графов, то наверняка знаете это чувство: открываешь PDF, а там на третьей странице начинается зубодробительная алгебра, абстрактные группы, матрицы и греческий алфавит, от которого хочется закрыть вкладку и пойти заварить чай.
Сегодня мы поступим иначе. Никаких многоэтажных интегралов и душных доказательств. Только суть, жизненные аналогии и инженерный азарт.
Разберемся, как с помощью концепта ENIGMA Ω собрать идеальную архитектуру процессора из математических «кубиков LEGO» — на основе нашей фундаментальной работы с Брентом и Мьяо (публикацию можно найти на Zenodo).
В чем проблема современных процессоров?
Представьте, что вы строите огромный логистический центр. У вас есть тысячи сортировщиков (ядра процессора), но всего пара узких дорожек, по которым они передают друг другу коробки с данными (шина данных и память).
Сколько бы ядер вы ни добавили, система упрется в транспортный коллапс:
Данные долго едут от памяти к вычислителю.
Маршруты пересекаются, возникают пробки (конфликты шины).
Энергия тратится на гонки, а не на полезную работу.
Инженеры десятилетиями думают: «А можно ли расположить вычислительные блоки и связи между ними так, чтобы передача данных всегда шла по идеальному кратчайшему пути, а соседние элементы не мешали друг другу?»
Спойлер: Можно. Если использовать правильную математику.
Встречайте: Теория ENIGMA Ω и кубики LEGO
Теория ENIGMA Ω — это, по сути, универсальная инструкция по сборке идеальных вычислительных сетей.
Представьте, что у вас есть набор деталей LEGO. В обычном мире вы можете скрепить их как попало — получится что-то хрупкое или неуклюжее. Но в мире ENIGMA Ω каждый кубик обладает тремя строгими свойствами:
Симметрия: Неважно, с какой стороны вы смотрите на модуль или сеть — правила передачи информации одинаковы. Никаких «любимых» или «изолированных» ядер.
Оптимальная связность (Спектральный зазор): Помните игру «шесть рукопожатий»? В сетях ENIGMA Ω от любой точки А до любой точки Б можно добраться за минимальное число шагов. Информация не «застревает» в блужданиях.
Фрактальная масштабируемость: Вы можете взять маленький идеальный процессор, объединить тысячи таких же по определенному правилу — и получить гигантский суперкомпьютер, который сохранит все идеальные свойства базовой детальки.
Как это работает «на пальцах» (и чуточку символов)
В основе ENIGMA Ω лежит концепция алгебраических графов-экспандеров.
Представьте себе кристаллическую решетку алмаза, но перенесенную в многомерное пространство:
Узлы (вершины) — это процессорные ядра или элементы памяти.
Рёбра (связи) — это физические каналы связи на кремниевом кристалле.
Когда нам нужно посчитать сложную задачу (например, обучить нейросеть или просчитать физику взрыва), мы разбиваем её на миллионы микрозадач.
В традиционном процессоре эти микрозадачи начинают «толкаться локтями». В архитектуре ENIGMA Ω структура связей автоматически распределяет поток данных так, как будто разбрызгиватель идеально равномерно поливает газон. В математике это называются «экспандерными свойствами».
Минимальная формула дня (promise, она одна!):
Если мы опишем такую сеть матрицей, то разница между первым и вторым её «собственным значением» ($\lambda_1 - \lambda_2$) определяет скорость перемешивания информации. В ENIGMA Ω этот показатель максимален — информация распространяется с предельной физически возможной скоростью!
Почему это важно для реальной инженерии?
Это не просто абстрактная красота на бумаге. Применение теории ENIGMA Ω дает конкретные железные плюсы:
Защита от сбоев: Если в процессоре на 10 000 ядер выгорит 500 штук, сеть ENIGMA Ω даже «не заметит» этого — маршруты информации мгновенно обойдут повреждения без потери общей связности.
Минимальное энергопотребление: Чем короче путь сигнала по чипу, тем меньше греется кремний.
Простота проектирования: Вместо того чтобы вручную разводить миллиарды транзисторов, топология генерируется строгим математическим алгоритмом.
Что дальше?
Мы с Брентом и Мьяо сформулировали математический фундамент и опубликовали препринт работы на Zenodo, где дотошно, шаг за шагом расписали всю алгебру, стоящую за этой концепцией.
Сейчас мы находимся на самом интересном этапе: превращении этой теории в реальные архитектурные шаблоны для перспективных процессоров, нейроморфных чипов и квантовых вычислителей.
Ссылки и материалы:
Полный текст научной работы (для тех, кто не боится строгой математики и теорем) доступен в нашем репозитории на Zenodo: https://doi.org/10.5281/zenodo.21972718
Debian исполнилось 33 года
16 августа 2026 года одному из старейших активно развиваемых Linux-дистрибутивов — Debian — исполнилось 33 года. Проект был основан Яном Мёрдоком 16 августа 1993 года, когда само понятие полноценного Linux-дистрибутива ещё только формировалось. С самого начала Debian создавался как свободный и открытый Linux-дистрибутив, развиваемый сообществом. Этому принципу проект следует и сегодня.
За эти годы Debian превратился из небольшого проекта энтузиастов в один из важнейших дистрибутивов в мире Linux. Он известен своей стабильностью, развитой системой пакетов и строгим подходом к свободному ПО. Debian также стал фундаментом для множества других дистрибутивов — самый известный пример, конечно, Ubuntu.
Спустя 33 года Debian продолжает активно развиваться и остаётся востребованным как на серверах, так и на обычных компьютерах. При этом сам проект по-прежнему развивается международным сообществом разработчиков и участников. Для мира Open Source 33 года непрерывного развития — действительно впечатляющий срок. С днём рождения, Debian! 🎉
Израиль выступил без флага на олимпиаде по информатике
Сборная выступала на 38-й Международной олимпиаде по информатике (IOI 2026), проходившей 9-16 августа в Ташкенте. Четыре израильских участника завоевали три золотые и одну бронзовую медаль. В соревновании участвовали 375 школьников из 92 стран и территорий.
Израильские школьники выступали в Ташкенте не как официальная национальная делегация, а под флагом Международной олимпиады по информатике. Такое ограничение действует после решения Генеральной ассамблеи IOI, принятого в 2024 году в связи с войной в Газе: Израиль перестал признаваться участвующей делегацией. В 2025 году руководство олимпиады решило сохранить действовавшие санкции в отношении Израиля.
зы: кто какие места занял по странам в общем зачете смотрите в комментарии, потому что нет ссылки на оф СМИ, а только на сайте олимпиады надо высчитывать.









