Продолжение поста «Получение эмодзи (пиктограмм) денег»2
Кто принимает решение о присвоении эмодзи кодов UTF?
Решение о присвоении эмодзи кодов UTF принимает Консорциум Юникода (Unicode Consortium) — некоммерческая организация, отвечающая за стандартизацию текста и символов по всему миру. Если упростить процесс, то окончательное решение — за Техническим комитетом (UTC), но ему предшествует серьезная подготовительная работа.
Вот как выглядит полная "цепочка принятия решений" и кто в нее входит:
🗳️ Кто принимает финальное решение?
Конечное слово остается за Техническим комитетом Консорциума Юникода (UTC — Unicode Technical Committee). Это группа экспертов, представляющая компании-члены консорциума.
В состав голосующих членов входят крупнейшие технологические компании (Apple, Google, Microsoft, Adobe, IBM и др.), а также некоторые государственные структуры (например, правительство Индии имеет полголоса). Комитет собирается несколько раз в год на закрытые заседания, где утверждает или отклоняет предложения.
📝 Подготовительный этап (Рабочая группа)
Перед тем как попасть на голосование UTC, каждая заявка проходит глубокую экспертизу в Подкомитете по эмодзи (ESC — Emoji Subcommittee).
Руководитель: Дженнифер Дэниэл (также руководит дизайном эмодзи в Google).
Задача: Этот комитет оценивает сотни заявок от обычных людей и организаций, проверяет их на соответствие строгим критериям, запрашивает доработки и готовит рекомендацию для UTC. Обычно UTC прислушивается к их мнению.
👤 Можете ли вы повлиять?
Да, процесс открыт для всех. Любой человек или компания может подать заявку на добавление нового эмодзи. Однако это не просто письмо с просьбой, а полноценное исследование.
Что нужно для заявки (согласно правилам Unicode):
Доказательства популярности: Скриншоты частоты использования запросов, статистика хештегов (анекдотические данные вроде «все мои друзья хотят этот эмодзи» не принимаются).
Отличительные черты: Символ не должен дублировать существующие (например, «уборщик» не пройдет, так как уже есть метла).
Многозначность: Желательно, чтобы у символа было несколько значений (например, акула — это не только рыба, но и «акула пера» или финансовая акула).
Открытость: Вы должны подписать лицензию, разрешающую использовать ваш дизайн бесплатно и навсегда (эмодзи нельзя удалить из стандарта).
Сроки: Заявки принимаются в определенные «окна» (например, с апреля по июль), а решение объявляют в ноябре того же года.
💡 Важное замечание о дизайне
Решение Консорциума Юникода касается только кода и описания (например, U+1F602 — "Лицо со слезами радости"). Консорциум не рисует сами картинки.
Что делает Unicode: Утверждает, что такой символ существует, и задает его абстрактное описание.
Что делают Apple, Google, Samsung и др.: Получают этот код и рисуют свой вариант того, как это «лицо со слезами радости» будет выглядеть в их системе. Поэтому один и тот же эмодзи на айфоне и андроиде выглядит по-разному, но код у него один.
Резюмируя: Идею можете предложить вы, её оценит комитет экспертов во главе с Google, а финальный «зеленый свет» дает Технический комитет, где решающий голос у Apple, Microsoft и других гигантов индустрии.
Ответ на пост «В эмодзи MAX есть бородатые женщины»1
Вы неправы.
Сразу обозначу: 1. Я ненавижу MAX, равно как и тех, кто его насильно продвигает. 2. Смайлики бородатых женщин для меня — идиотия.
Но в данном случае — наличие неадекватных смайликов в мессенджере — создатели MAX не при чем, потому что смайлики — это такие же символы, как буквы, цифры, знаки препинания. Смайлики ничем принципиально не отличаются от того, из чего состоит этот комментарий, потому что это все — кодовые позиции символов Unicode. Unicode это мировой стандарт де-факто для кодирования любого текста в те самые нолики и единички, чтобы компьютеры могли их хранить и передавать. Сам по себе Unicode — технически гениален. Его наполнение — во многом очень спорно. Наполнение Unicode контролируется Unicode Consortium (Калифорния, США).
Perplexity говорит, что
Смайлики бородатых женщин были добавлены в стандарт эмодзи Emoji 13.1 в 2020 году, а на устройствах появились в 2021 году.
Создатели MAX ничего не добавляли, они просто предоставили все те смайлики, которые есть в стандарте Unicode. И никто с этим ничего не сможет сделать, как бы мерзко это ни было.
MAX, тем не менее, — гори в аду!
Экранирование и валидация
Изучаю вопрос валидации / экранирования / санитации ввода в цифровом продукте.
Все, что пишу ниже, пишу не с целью опрокинуть чье-то приложение или сайт, а с целью защитить ввод в своем приложении, которое разрабатываю как android разработчик.
Нужны мысли и мнения, какие символы и комбинации стоит экранировать на вводе, чтобы не упал json, а UI не плясал дикие пляски.
Пишу без примеров, так-как в Пакабе в опубликованном посте они прекрасно подчищаются.
Из того, что смог получить общаясь с нейросетью:
1. Bidi-управление - делает неожиданное поведение курсору при выделении, движении через символы.
Энциклопедия символов «Юникодия»: итоги года
Я всё ещё продолжаю писать открытую энциклопедию Юникода и замену стандартной Таблице символов. И даже провёл новогоднюю ночь за подтягиванием мелких глючков, обнаруженных за написанием этой заметки. Качать тут.
Все подводят итоги года — и я подведу.
Тизер: рассказ про венгерские руны
Вот таких текстов в Юникодии больше сотни килобайт.
• Тип: алфавитная — как кириллица
• Направление: ←
• Языки: венгерский
• Появилась: X век (возможно, раньше)
• Состояние: историческая, не требует расшифровки (как глаголица)Неизвестно, как старовенгерские руны связаны с тюркскими: то ли произошли от них, то ли сестринские письменности.
Иштван I, первый король Венгрии, объединил венгерские племена, обратил в христианство и около 1000 перешёл на латиницу, но руны продолжают использоваться, постепенно угасая. Последние надписи датируются ≈1800.
С XVII века началось изучение, около 1900 проведена основная работа и даже придумали руны для недостающих звуков венгерского. Венгры гордятся рунами и иногда дублируют ими надписи. Но мало кто умеет читать руны: в 2017 шутники заменили знак города Эрд (Érd) на «Szia» (привет, оба слова длиной 3 руны), и заметили это через месяц.
Полный Юникод 17 без тофу (лето)
Я интегрировал уже пять версий Юникода. Но только в этой, семнадцатой, мне активно предлагали свои наработки. А конкретно — тангутский и арабские лигатуры. Так что закрыл все тофу ещё до сентября, когда Юникод выходит в выпуск.
Нет, в позиции 18CFF не тофу, а символ малого киданьского письма «иероглиф неразборчив». Обычно с этой целью используют какую-то геометрию, но именно в киданьском и египетском есть сложное форматирование, потому разунифицировали.
Первая версия компилятора ККЯ (весна)
GlyphWiki — очень интересная платформа. Она описывает иероглифы вот таким простеньким языком.
За этим языком стоит очень сложный визуализатор, написанный на JavaScript — и я нашёл, запустил и интегрировал продвинутую версию этого визуализатора, которая строит иероглифы из кривых (а не отрезков). Портация визуализатора на Си++ идёт с переменным успехом.
До этого я качал с GlyphWiki SVG-файлы из отрезков, но полуавтоматическая доводка этого дела до рабочего шрифта была тем ещё делом.
Чтобы всё заработало, мне помогли наработки по совсем другой письменности…
Действующий египетский шрифт (продолжается работа)
Шрифт полусвободный, единственное ограничение (не моё) — запрещено применение в альтернативных иероглифических процессорах. Поскольку Юникодия таковым не является, для меня это не важно — зато очень красив.
Шрифт теперь годен вне Юникодии, потому что имеет очень приличное покрытие:
Египетские иероглифы — все 1072.
Форматирующие символы для египетских иероглифов — все 38, но на уровне затычек.
Египетские иероглифы расширенные A — более 3450 из 3995. Штук пятьсот из них мои.
Вот так выглядит имя Тутанхамон в моём шрифте.
На самом деле почти никто не поддерживает сложное форматирование — потому что оно плохо вписывается в возможности шрифтовой системы OpenType. Египтологи ждут поддержку WebAssembly-скриптов в шрифтах.
Турецкая локализация (лето)
Объявился турок и сделал полный перевод.
Улучшенная навигация (лето)
Решились два вопроса.
Теперь любой рассказ может ссылаться на любой символ. Очень красиво вышло в описании иероглифов.
Юникодия — это запутанный гипертекст, и если всплывающее окно закрылось или кривая вас увела непонятно куда,— ничего страшного. Всегда можно вернуться по цепочке назад.
Windows 11 и тесные экраны (осень-зима)
Раз уж на моём дополнительном ноутбуке лицензионная 10 Pro с бесплатным апгрейдом до 11, написал серьёзные алгоритмы поддержки всплывающих окошек на тесных экранах.
В них запрограммировано:
избегать окон выше 3:4;
избегать окон выше 650 аппаратно-независимых пикселей (анп);
самое узкое окно — 450 анп, но если удаётся ещё сузить, не поднимая высоты,— сделать это;
если мы сужаем окно, а оно не становится выше,— брать не самое узкое, чтобы абзацы не уплотнялись в кирпич;
делать окно шире 850 анп в крайних случаях, если по-другому никак не вместить в экран.
Потери года
Брошена поддержка японского языка: японец ухаживает за серьёзно больной женой.
Из его локализации я понял, что японский язык имеет довольно сложные методы записи приблизительных чисел (чего-то вроде «130 тысяч»). И я даже запрограммировал эту поддержку, но не могу достучаться, чтобы он проверил. О допереводе я даже не заикаюсь.
Текст гласит: 3 млн = 300·10.000 владеющих лаосским языком как родным в Лаосе, и 4 млн как вторым; ещё >20 млн в Таиланде пользуются тайским письмом.
Умер спец по китайским иероглифам, с которым я советовался.
Я с ним советовался, ловил ошибки в его шрифте BabelStone Han — и вдруг он не вышел на связь. Вскоре я узнал страшную весть: сердечный приступ. Скорее всего, шрифт придётся бросить.
А пока — с Новым годом!
Что ожидается в Юникоде 18
В КОВИД сформировался удобный цикл Юникода: январь — альфа-версия, весна — бета, сентябрь — выпуск. Повангуем, что там будет.
Мы тут за эмодзями — на вот, берите их скорей!
Зажмурившийся колобок. Не так «зажмурившийся», как 😵, и может означать: упрекнуть, сосредоточиться, взглянуть, рассмотреть, сомневаться, неуверенность.
Большой палец в сторону: показывать, схватить, вон тот, влево/вправо.
Огурец: соленья, закуска, мариновать, пиклбол. И да, это тоже (хотя традиционно используют баклажан). А у нас — ещё и водка.
Бабочка-монарх: распространённая американская бабочка, и не могу по её поводу ничего сказать. Ну, важная американская перелётная бабочка, Ну, символизирует изменение.
Метеор: катаклизм, фаербол из ролевых игр, апокалипсис.
Стирательная резинка: стереть, откатить, ошибка, тереть.
Маяк: надежда, навигация, море, просвещение, сигнал.
Сачок: ловить, коллекционировать, ловушка, сетка. Ну а у нас — прогуливать.
Буквально за месяц до выпуска Юникода 17 отложили огрызок. Теперь его окончательно выбросили и заменили огурцом.
Продолжается работа по стандартизации изображений, вот немногое:
Животным (птице 🐦, еноту 🦝 и, по-видимому, лосю) нужна полная фигура, не только голова.
Кирпичи 🧱 должны быть именно кирпичами, а не целой стеной. Возможно, позже разунифицируют — разделят один символ на два, как когда-то сделали с «едва сдерживает смех» 🤭 (Google, Microsoft) и «невообразимый ужас» 🫢 (Apple, Facebook).
Колесо 🛞 автомобильное с резиной.
На коленях 🧎♂️ — на двух. Возможно, позже разунифицируют.
Корзина 🧺 пустая.
Лыжный сапог 🎿 — сконцентрироваться на лыжах.
Теннис 🎾 — убрать мяч, хватит ракетки.
Счётные знаки старой клинописи
Клинопись выросла из хозяйственных документов — сначала стали писать бухгалтерские ведомости, и только потом тексты.
Вот знаменитое видео про первую известную математическую ошибку в исполнении некоего Кушима.
Чисой
Тип: алфавит →
Язык: курмальский (Индия), 550 тыс.
Состояние: развивается с 1986
Конкурирующие письменности: деванагари, бенгальская, ория
Письменность почти приняли в Юникод 17, но вернули на доработку. В новой версии добавилась одна буква.
Заглавные арабские буквы
Арабский алфавит безрегистровый, но египетского короля Фуада I (правил 1922–1936) подмывало сделать как в Европе — он нанял каллиграфов, и получились буквы с короной (ну или куполом мечети) на вершине.
Арабский пишется сплошной вязью, и у каждой буквы есть изолированная, начальная, средняя и конечная формы. Понятно, что у заглавных букв существуют только изолированные и начальные версии.
Ну и, конечно, куча корановских меток. Декламирование Корана — любимое занятие ардритов мусульман с планеты Земля, и попробуй сделать паузу не там, где надо…
Латиница
Все знают, что английская орфография страшна как чёрт, и радикальные попытки её улучшить вроде мормонского алфавита или алфавита Шоу потерпели фиаско. Но детей надо как-то учить, да так, чтобы они потихоньку подхватывали эту корявую орфографию, и существовали несколько таких алфавитов.
Кто знает, откуда отрывок? ↑↑
Третий такой алфавит, Юнифон (США, 1950-е), пока не рассматривается.
Ну и очень много разной фонетики. Эти крючки часто означают мягкий звук.
Альтернативная запись, использовавшаяся на машинках,— перечеркнуть букву горизонтальной чертой. Значить может что угодно в зависимости от языка и предназначена для оцифровки полевых заметок языковедов.
Чжурчжэньские иероглифы
Тип: историческое логофонетическое, ←↓↓ по столбцам, закодированы →
Язык: чжурчжэньский (предок маньчжурского)
Состояние: брошены с завоеванием Китая монголами, ≈1260
Китай был настолько крутой цивилизацией, что все вокруг брали китайские иероглифы и на их основе придумывали что-то своё. Известны были только надписи, пока в 1968 году в Ленинграде среди тангутских бумаг не нашли чжурчжэньскую.
Иероглифы с печатей
Тип: логографическое, ←↓↓ по столбцам, закодированы →
Язык: тогдашние диалекты китайского
Состояние: брошены в I тыс днэ
Когда мы хотим произвести впечатление древности, мы используем кириллический устав или полуустав. А китайцы ≈300 днэ использовали старые формы иероглифов. Эти формы и поныне сохранились на печатях людей и организаций.
Сирмаури
Тип: абугида →
Язык: сирмаури (Северная Индия, 100 тыс)
Состояние: брошена в XX веке
Конкурирующие письменности: арабский-урду
Неизвестно, откуда письмо появилось, но очень похоже на другие беглые письменности Индии. Возможно, отложат до Юникода 19.
Музыка
Полутон (1/12 октавы), если не имеет своей ноты, обозначается знаком ♯ диез или ♭ бемоль. Всё чаще встречается четвертьтоновая музыка, когда в ключевых местах используются сдвиги на 1/24 октавы.
Имеющаяся в Юникоде четвертьтоновая запись 𝄲𝄳 почти нигде не использовалась, мало кто видел её вживую. Музыкальное ПО использует полудиез и полубемоль.
Ну и много другой музыки — редкие ключи, сверхкороткие ноты, работа смычком…
Валюты
Сразу две: мальдивская руфия́ (символ с 2022) и дирхам ОАЭ (символ с 2025).
Я продолжаю разрабатывать программу «Юникодия» — лучшую замену Таблице символов. Качать тут.
DSL KeyPad — ввод 6300+ символов Юникода@0.1.7.3 альфа
В предыдущем посте я рассказала о программе, позволяющей вводить тысячи символов Юникода с клавиатуры рядом способов: клавиатурные привязки, режим «Композиции» (аналог «Compose»), функция «Поиска». Понемногу продолжаю улучшать и расширять её возможности, а в этом посте описаны основные изменения за серию обновлений (0.1.3.2 α >>> 0.1.7.3 α).
Для быстрой справки: библиотека программы состоит из внушительного перечня символов латиницы, кириллицы, греческого, ряда исторических форм письменности и иных различных символов: валютные, математические и пр. GitHub репозиторий с релизами тут.
Это позволяет писать на внушительном перечне языков, имея лишь английскую и русскую раскладки, и иметь под рукой символы под разные нужды. Нужен интеграл? «Поиск» → запрос «интеграл» → вставит в поле ввода «∫».
Что нового?
В общем библиотека символов возросла с 4700+ до 6300+ символов.
Добавлены новые формы письменности, чьи наборы привязок доступны в «Альтернативном вводе»:
Пополнились и «Вариации глифов». Новыми альтернативными формами символов стали:
Региональные индикаторы (позволяют вводить символы, формирующие флаги: 🇻 🇦 🇧 🇬 🇰 🇿 🇷 🇺 🇲 🇩 🇷 🇸 → 🇻🇦🇧🇬🇰🇿🇷🇺🇲🇩🇷🇸)
Теги (как я поняла, это устаревшие символы для разметки, ныне используются для записи ещё ряда флагов: 🏴<теги gbwls/gbsct/gbeng><закрывающий тег> → 🏴 🏴 🏴 дадут флаги Уэльса, Шотландии и Англии [сами теги невидимы при вводе])
Символы в круге (Ⓒⓘⓡⓒⓛⓔⓓ ⓢⓨⓜⓑⓞⓛⓢ)
… в закрашенном круге (🅝🅔🅖🅐🅣🅘🅥🅔 🅒🅘🅡🅒🅛🅔🅓)
… в двойном круге (⓵⓶⓷⓸⓹⓺⓻⓼⓽⓾)
… в квадрате (🅂🅀🅄🄰🅁🄴🄳 🅂🅈🄼🄱🄾🄻🅂)
… в закрашенном квадрате (🅽🅴🅶🅰🆃🅸🆅🅴 🆂🆀🆄🅰🆁🅴🅳)
… в скобках (🄟⒜⒭⒠⒩⒯⒣⒠⒮⒤⒮⒠⒟ ⒮⒴⒨⒝⒪⒧⒮)
… с точкой/запятой (⒈⒉⒊⒋⒌ | 🄂🄃🄄🄅🄆)
… контурные () [недоступны через селектор]
… сегментированные (🯱🯲🯳🯴🯵🯶🯷🯸🯹🯰) [недоступны через селектор]
Добавлены/расширены наборы тематических символов:
Алхимия, астрология и астрономия раньше были представлены 48-ю символами, теперь же набор состоит из 234-х символов.
С расширением этих наборов были улучшены генерация названий/тегов и поиск в главном окне.
Алхимические, астрологические и прочие символы могут нести ряд значений.
Пример: символ Юпитера «♃» в алхимии означает олово, и оба значения присутствуют в его тегах. При вводе «Олово» в строке поиска главного окна список отобразит «Алхимический символ элемент Олово» вместо стандартного названия «Астрологический символ планета Юпитер».
Улучшена логика отдельной функции «Поиска», вставляющей символы по запросу: теперь при вводе без пробела ищет цельное слово. Раньше ввод «олово» давал символ «〈» («восточная левая заголовочная кавычка»). Теперь олово даёт… олово ♃. Дополнение полезно и для ранее добавленных символов: теперь для получения альтернативных форм не нужно писать что-то в духе «!lat let a::mo» для получения надстрочной «ᵃ», теперь достаточно «!a::mo».
Дао, И-Цзин и Таосюань-Цзин (165)
Представлены следующими символами:
3 Монограммы: ⚊⚋ (И-Цзин) + 𝌀 (Тайсюань-Цзин)
9 Диграмм: ⚌⚍⚎⚏ (И-Цзин) + 𝌁𝌂𝌃𝌄𝌅 (Тайсюань-Цзин)
8 Триграмм: ☰☷☳☵☶☴☲☱ (И-Цзин)
81 Тетраграмма: 𝌆𝌇𝌈𝌉𝌊𝌋𝌌𝌍𝌎𝌏𝌐𝌑𝌒𝌓𝌔𝌕𝌜𝌝𝌞𝌟𝌠𝌡𝌢 … (Тайсюань-Цзин)
64 Гексаграммы: ䷀䷁䷂䷃䷄䷅䷆䷇䷈䷉䷊䷋䷌䷍䷎䷏䷐䷑䷒䷓䷔䷕ … (И-Цзин)
Дополнительно: стилизованные символы 🉠 удачи ⟨福⟩, 🉡 процветания ⟨祿⟩, 🉢 долголетия ⟨壽⟩, 🉣 счастья ⟨喜⟩, 🉤 любви/свадьбы ⟨囍⟩ и 🉥 богатства ⟨財⟩ (если они отобразились квадратиками — шрифт Noto Sans Symbols 2)
Вместе с ними добавлен и режим «Альтернативного ввода», но монограммы доступны и в стандартных привязках: RAlt + LAlt + 9 = ⚋⚊ / RAlt + LAlt + 0 = 𝌀.
Здесь также виден пример замены названия в списке: Тайсюань-Цзин разделяет монограммы «⚋⚊» и диграммы «⚏⚎⚍⚌» с И-Цзин.
Прочие наборы символов:
16 Геомантических фигур — пришли вместе с недавним релизом Unicode 17 (могут поддерживаться не везде).
Шахматные фигуры (31): ♔♕♖♗♘♚♛♜♝♞♟.
Карточные масти: закрашенные/контурные и эмодзи варианты ♠♥♦♣♤♡♢♧♠️♥️♦️♣️ (некоторые приложения/сайты могут принудительно преобразовывать закрашенные в эмодзи).
Игральные карты (81): 56 «обычных», 3 джокера, 1 дурак, 1 рубашка и 21 козырная карта «Таро Нуво» 🃘🃌🂽🂡🂠.
Плитки/кости Маджонг (43): 3 масти по 9 костей, 7 благородных костей, 8 цветов/сезонов, джокер Американского Маджонга 🀤🀖🀛🀄.
Фигуры Сянци (14): 🩠🩡🩢🩣🩤🩥🩦🩧🩨🩩🩪🩫🩬🩭.
Плитки домино (100), горизонтальные и вертикальные варианты 🁏🀽🁦🂓.
Другие дополнения
Расширен перечень прочих символов: кириллицы, латиницы и т.д.: ꜣ Ꜣ ꜥ Ꜥ ℥ ℈ ℀ ℁ ⅍ ℅ ℆ ℄ …
Для удобства работы с Международным фонетическим алфавитом добавлены отдельные вкладки для символов его «Альтернативного режима» и рецептов.
Вкладка «Помощь» пополнилась новой информацией.
Расширен набор поддерживаемых раскладок латиницы, в сумме: QWERTY, AZERTY, Asset, Blaze, Canary, Colemak, Dhorf, Dvorak, Engrammer, Focal, Gallium, Graphite, Halmak, JCUKEN, Kuntem, Nerps, Norman, Pine, Qwickly, Rain, Recurva, Stronk, Sturdy, Workman.
Расширен набор поддерживаемых раскладок кириллицы, в сумме: ЙЦУКЕН, Диктор, ИІУКЕН (1907), ЯШЕРТЫ, Харламак, Рулемак.
Наиболее важные изменения и исправления
Режим «Композиции» теперь поддерживает кастомизацию: размер шрифта, шрифт, цвет текста и фона, ограничения символов для обрезки подсказки, возможность отключить отображение избранного, предложений и выбор показа альтернативных рецептов совпадающих символов (вкл: покажет все рецепты для совпавшего символа, выкл: покажет только текущее совпадение).
Селектор для Альтернативных режимов также заимел немного кастомизации: количество выводимых пунктов на страницу, максимальное количество колонок и порог, когда они активируются; возможность использовать цифровые клавиши.
Исправлена ошибка при запуске на Windows 11 (появившаяся в версии 0.1.5.3 α), а так же невозможность ввода символов привязок в поле «Композиции» на этой же ОС.
Исправлена критическая ошибка в режиме «Композиции», вызываемая вводом символов «?+()[]».
Исправлена ошибка при использовании в пользовательских рецептах мультиссылок формата ${\m,u,l,t,i/}: раньше при запуске программы такая ссылка сравнивалась в лоб, вместо разбора на отдельные и сравнения каждой.
Исправлены ошибки, связанные с добавление в избранное и удаления из него.
Исправлен недостаток режима «Композиции» из-за которого был невозможен ввод рецептов с символами из суррогатных пар (символы с кодовой точкой из пяти значений, представляют из себя два символа: 🜍 = U+1F70D = U+D83D и U+DF0D).
Теперь в режиме «Композиции» показывается символ, соответствующий текущему режиму «Вариации глифов».
Изменения для модификаций: изменения файла информации о моде; добавлена возможность создать базовый шаблон мода прямо из окна модификаций; теперь создатель мода может добавить локальные настройки и они будут доступны через соответствующую кнопку в окне модификаций, однако интерфейс окна настроек необходимо будет создать самому
Появился вспомогательный класс «ModTools», автоматически инициализируемый в экземпляре класса мода при его создании через интерфейс и содержит сейчас следующие параметры: origin (директория мода); dirName (имя директории); paths.data/locale/lib/resources (пути до локальных папок); config (экземпляр класса для управления настройками: Set/Get); config_editor (переменная для назначения в неё GUI окна настроек мода). Под изменения системы модификаций был обновлен мод-пример.
Более мелкие исправления включают в себя изменение ошибочных рецептов, ошибок параметров отдельных символов, исправление ошибок в обработке записей символов, добавление пропущенных привязок и прочие улучшения.
Что дальше?
Продолжу улучшать программу и пополнять её новыми/пропущенными символами, а возможно и новыми фичами.
— Но… зачем это мне?
Мой инструмент может быть полезен, если вы:
Лингвист/филолог, пользуетесь Международным фонетическим алфавитом, интересуетесь семитскими и анатолийскими языками; с учётом охвата латиницы и рун можно упомянуть и германские языки (Древнеанглийский [Ænglisċ], Древнескандинавский [Dǫnsk tunga / Norrœnt mál] и пр.); а с учётом кириллицы и глаголицы — Старославянский язык [Словѣньскъ ѩꙁꙑкъ].
Составляете конланги на основе существующих форм письма.
Пишите на трёх и более языках, при этом ища альтернативы обычным языковым раскладкам (например, мне самой не удобно, когда одна графема на раскладках разных языков — в разных местах, пусть это и логично).
Занимаетесь типографикой/дизайном и вас не удовлетворяет арсенал «Типографской раскладки» (здесь намного больше разных пунктуационных знаков, вариаций пробела и т.д.; ещё в программе есть и своя функция «Оттипографить»).
А может даже интересуетесь темой оккультизма, алхимии, гадательных практик и хотели бы использовать соответствующие символы без Ctrl+C Ctrl+V и карт символов.
Или просто нуждаетесь в символах, обычно недоступных на клавиатуре/доступных только с Alt+XXXX комбинаций.
«Ограничения и нюансы» остаются такими же, как описаны в предыдущем посте, однако после контентных добавлений потребление ОЗУ в пике может дойти до 190 МБ (раньше 180, первичный запуск программы + первичный запуск главного окна) (без учёта модов и пользовательских рецептов).
Дубль ссылок на предыдущий пост и GitHub-репозиторий.
🜍♅ Спасибо за прочтение ♅🜍
Энциклопедия символов «Юникодия»: версия 3.0!
Я всё ещё продолжаю писать открытую энциклопедию Юникода и замену стандартной Таблице символов. Качать тут.
Вот отчёт за последние полгода.
Всплывающее окно: символ
Теперь, чтобы увидеть символ и скопировать тривиальную информацию по нему, можно просто ткнуть на ссылке.
Панель Подборок из синей стала зелёной: теперь это не переход.
Внизу ссылочка «◀◀◀ U+FE0F». Она во всех всплывающих окнах: если вдруг вы закрыли, или любопытство завело вас непонятно куда, вы легко можете вернуться туда, где были. История запоминается на целых 100 шагов.
Иероглифы разные
Эмодзи. Обратите внимание на балерину выше: подтянул свежую библиотеку Google Noto. Только косатку оставил свою: ну не получился у Гугла хищный зубатый кит.
Флаг Сирии заменил на бенладенский, вслед за Ябблом.
Египетские. Сейчас они обслуживаются тремя шрифтами.
Google Noto: проверен египтологами. Низкие кегли совсем не держит. Покрывает базовый блок 2009 года.
NewGardiner: нарисован египтологом, но единичные ошибки есть. Низкие кегли отлично держит. Коряв как чёрт. Покрывает подтверждённые иероглифы (600 расширенных намеренно опущены).
Мой, основанный на JSesh (программе-редакторе египетских текстов). Низкие кегли неплохо держит. Покрытие рандомное. Пришлось проверять и перерисовывать, но такая красотища! Разногласия решались простым большинством из трёх источников: изображения Юникода, описания Юникода и NewGardiner.
Шрифт буду потихоньку расширять, пока буду жив, и последовательность такая.
Стадия 1. Три шрифта в сумме покрывают все египетские иероглифы. Выполнено в июле, нарисовано и перерисовано несколько десятков иероглифов.
Стадия 2. Все символы моего шрифта проверены на простейшую корректность. Выполнено только что, сделано более 600 иероглифов. Главный вопрос — борода: у египтян короткая, у фараонов длинная, у богов крючком.
Стадия 3. Шрифт растяну на 1100 символов основного блока. Будет ХЗ когда, предполагаемый срок — после Нового года. Рассчитываю на 200…300 иероглифов работы.
Стадия 4. Буду поддерживать все египетские иероглифы. Будет минимум через полтора года и 800 иероглифов.
Поставил на свой шрифт такие требования: 1) если человек держит что-то, оно всегда будет изображаться гипертрофированно; 2) если минимальная причёска и ничего не говорится про бороду — то бороды нет; 3) только очень близкие символы приводятся в единый стиль.
Тангутские. Просто нашёлся человек, нарисовавший всё, что было.
Арабский. Он же нарисовал временные изображения арабских лигатур.
И Сулейман ибн Дауд — мир с ними обоими! — приказал принести два сосуда: один медный, а — другой глиняный, и заточил меня в глиняном сосуде, а брата моего, Омара Хоттабовича, — в медном.
Лазарь Лагин. Старик Хоттабыч. — М: 1959
Вот такие стандартные фразы часто заменяются лигатурами (склейками), примерно такими.
Китайские. Китаевед Эндрю Уэст стал более публично работать над своим шрифтом, я с ним советовался, проверял его на ошибки… и вдруг он неожиданно помер! Что с ним дальше делать, просто не знаю: шрифт-то отличный, просто больше никем не поддерживается. Оставил небольшую «пасхалку» в его память, кто найдёт…
Нашёл более удачную библиотеку преобразования GlyphWiki→SVG, и теперь китайские подскочили в качестве.
Плохие новости для Windows 7 и необновлённой 10-ки: теперь самый-самый резервный китайский шрифт — новый стандартный SimSun-ExtG. Простите уж, и до этого были тофу — будет больше.
Турецкая локализация
Нашёлся турок, и мы с ним вместе сделали неплохой перевод.
А вот японский несколько застоялся: японец выхаживает серьёзно больную жену.
И тут получилась проблема: я не могу быстро изменить языки, которые не знаю. А ведь есть фразы типа «в базовой плоскости Юникода осталось 16 нераспределённых символов», или «изобретатель маджонг-пасьянса прикован к коляске, но жив» — пока истинны, но может измениться. Вот приходится писать что-то вроде «жив на 2025», и это 2025 — особый шаблон. Если узнаю, что умер,— напишу. А не известные мне языки продолжат гласить: жив на такой-то год.
Поиск
Обнаружилась ошибка: поиск неизвестного флага давал ошибочную строку. После разговоров с пользователем решил не убирать, только облагородил.
Докрутил поиск в египетских иероглифах. Иероглифы намеренно имеют пониженный приоритет.
Перебраны короткие словечки: где они играют роль, а где нет.
Почему сверху Белоруссия, понятно. Почему второй — именно этот слог письма и? А потому, что именно там BY — не предлог, а нечто значимое!
И… довольно странная просьба. Дело в том, что за обработку эмодзи отвечают сразу три подсистемы: вписанная в шрифт программа, типографский движок и высокоуровневая типографская библиотека где-то в прикладной проге. В результате такого разделения ответственности получается, что определённые нестандартные последовательности, тем не менее, корректно отображаются картинками-эмодзиками. Такие последовательности делятся на 1) минимально квалифицированные (скорее всего, отобразятся), 2) неквалифицированные (отобразятся, если будет угадан шрифт), и 3) странные (полагаются на особую реализацию эмодзи-шрифта).
Просили декодировать такие странные эмодзи.
Все такие нестандартные эмодзи у меня делятся на три категории: 1) поменяны местами мужчина/женщина, мальчик/девочка; 2) существует более короткая последовательность; 3) оба сразу.
Спасибо за внимание!



























































