Преобразование транскрипта из ютуба в статью
Я люблю смотреть исторические ролики на ютубе. Ну как смотреть? Мне больше нравится их читать. Для этого я извлекаю транскрипты и потом преобразовываю их в статью. Так мне просто лучше воспринимать информацию.
Как многие из вас знают, сырой транскрипт ютуба – это довольно-таки нечитабельная белиберда, особенно если текст довольно сложный. Вот тут нам на помощь и приходят большие языковые модели.
Я решил провести тест 10 топовых моделей, которые доступны бесплатно или практически бесплатно каждому пользователю, который умеет играть в КВН.
За основу был взят вот этот вот ролик продолжительностью полчаса с копейками
Качество получившейся из транскрипта статьи проверять я доверил модели Gemini 3.1 Pro. Попросив оценить каждый из транскриптов по 100-бальной шкале.
Вот ее выводы.
Кто лучше следовал исходному тексту:
Лидерство здесь делят GPT-5.4-ext-thinking, Qwen-3.6-max-preview и Claude-sonnet-4.6. Все три модели бережно перенесли 100% смысловой нагрузки исходника, не потеряв ни одной исторической детали, но при этом сделали текст читабельным.
Меньше всего искажений:
GPT-5.4-ext-thinking, Qwen-3.6-max-preview и Gemini-3.1-flash-lite-preview. Эти модели лучше всех справились с «чисткой» транскрипта и не придумали от себя ни одного лишнего факта, корректно распознав все имена собственные.
(Аутсайдеры в лице GigaChat, Minimax, GLM и Mistral остаются на своих местах с теми же критическими ошибками, галлюцинациями и английскими словами, пробивающимися сквозь перевод).
Итоговый рейтинг моделей (Топ-10)
GPT-5.4-ext-thinking (95/100) — Эталонная работа. Эта модель справилась с задачей блестяще. Она продемонстрировала выдающуюся способность восстанавливать искаженные исторические термины из аудио-транскрипта: правильно распознала Хузестанскую равнину («Kuzan plane»), царя Энмебарагеси («En Meisesi»), богиню Пиникир («Pineir») и династию Кидинуидов («Kadinuid»). Текст разбит на логичные абзацы с удачными подзаголовками, стиль выдержан в духе качественного научно-популярного лонгрида (без излишней сухости, но и без панибратства). Модель также четко выполнила инструкцию по удалению рекламного блока, оставив аккуратное и профессиональное примечание редактора в конце. Снижение на 5 баллов — исключительно за мелкие стилистические шероховатости, которые неизбежны при машинном переводе.
Qwen-3.6-max-preview (94/100) — Выдающийся результат. Блестящая реконструкция исторических терминов и идеальное примечание редактора. Чуть уступает лидеру лишь из-за слишком массивных абзацев в середине текста. Она продемонстрировала глубокое понимание исторического контекста и блестяще реконструировала фактологию из поврежденного транскрипта: искаженное «En Meisesi» превратилось в правильного Эн-Мебарагеси, «Pineir» — в богиню Пиникир, «Kuzan plane» — в Хузестанскую равнину, а «Kadinuid» — в династию Кидинуидов.
Claude-sonnet-4.6 (92/100) — Безупречный литературный слог. Слегка уступает первым двум моделям из-за мелких неточностей, но сохранил всю хронологическую последовательность и смысловые акценты автора, выдав, пожалуй, самый «литературный» и гладкий текст из всех. Он не упустил ни одной важной детали, но при этом немного ошибся в дешифровке некоторых имен (например, оставил «Эн-Месиси» вместо Энмебарагеси).
DeepSeek-v3.2 (89/100) — Отличная эрудиция и фактологическая правка текста. Прекрасно следовал исходнику, применив мощный механизм поиска знаний: модель даже добавляла вопросительные знаки там, где транскрипт был критически поврежден (например, «Kindattu (Кутир-Наххунте?)»), чтобы исправить исторические несостыковки.
Gemini-3.1-flash-lite-preview (88/100) — Очень качественная адаптация с прекрасным аналитическим примечанием редактора. Текст читается естественно. Заслуживает отдельной похвалы за свое примечание редактора: она прямо указала, что исходный текст содержал ошибки транскрипции (например, «ununiform» вместо «cuneiform»), и объяснила свои правки. Это идеальное выполнение роли трезвого и объективного редактора.
Kimi-k2.6 (82/100) — Крепкий, ровный перевод без откровенных провалов, но с несколькими историческими неточностями в именах царей.
Mistral-chat (65/100) — Хороший литературный стиль перечеркивается критической фактологической галлюцинацией (замена города Аншана на Аван на протяжении всего текста).
GLM-5-turbo (40/100) — Слабо. Модель допустила критическую ошибку, оставив непереведенные английские слова прямо посреди русских предложений.
Minimax-m2.7 (30/100) — Очень слабо. Огромное количество английского и китайского текста и серьезные проблемы с логикой построения фраз.
GigaChat-thinking (10/100) — Худший результат. Полная неспособность работать с зашумленными данными транскрипта, что привело к генерации абсурдных несуществующих имен и терминов. Полный провал в восстановлении исторических терминов. Модель буквально транслитерировала фонетический мусор, породив несуществующие сущности: «Кунанская равнина», «Кутиккинувау», «Худжаллу», «Ханунту III». Текст читается как альтернативная история. 😁
Что меня удивило? Ну, например, то, что ChatGPT неожиданно оказался на первом месте. Потому что мне его работа с текстом всегда нравилась... не очень. Слишком много он всегда сокращает, упрощает и т.д.
Но, оказывается, в режиме расширенного мышления он не сокращает и очень четко следует инструкциям. Надо брать это на вооружение. А то я привык работать с инстант-версией.
Так же круто себя проявил новейший Qwen3.6-max и как ни странно DeepSeek 3.2 - От последнего я не ожидал, действительно его неплохо исправили в новых версиях. Это при том, что мы с вами ждем со дня на день четвертую версию.
10-е место комментировать не буду можете сами в комментариях отметить и поздравить! То-то я, когда читал, удивился таким странным именам царей и прочих правителей древности в его изложении. 😂
Вне рейтинга осталась Алиса Pro, которая вместо создания статьи сделала кратенькое саммари. Хотя промпт я всем моделям давал один и тот же...
Искусственный интеллект
6.2K постов12.1K подписчиков
Правила сообщества
ВНИМАНИЕ! В сообществе запрещена публикация генеративного контента без детального описания промтов и процесса получения публикуемого результата.
Разрешено:
- Делиться вопросами, мыслями, гипотезами, юмором на эту тему.
- Делиться статьями, понятными большинству аудитории Пикабу.
- Делиться опытом создания моделей машинного обучения.
- Рассказывать, как работает та или иная фиговина в анализе данных.
- Век жить, век учиться.
Запрещено:
I) Невостребованный контент
I.1) Создавать контент, сложный для понимания. Такие посты уйдут в минуса лишь потому, что большинству неинтересно пробрасывать градиенты в каждом тензоре реккурентной сетки с AdaGrad оптимизатором.
I.2) Создавать контент на "олбанском языке" / нарочно игнорируя правила РЯ даже в шутку. Это ведет к нечитаемости контента.
I.3) Добавлять посты, которые содержат лишь генеративный контент или нейросетевой Арт без какой-то дополнительной полезной или интересной информации по теме, без промтов или описания методик создания и т.д.
II) Нетематический контент
II.1) Создавать контент, несвязанный с Data Science, математикой, программированием.
II.2) Создавать контент, входящий в противоречие существующей базе теорем математики. Например, "Земля плоская" или "Любое действительное число представимо в виде дроби двух целых".
II.3) Создавать контент, входящий в противоречие с правилами Пикабу.
III) Непотребный контент
III.1) Эротика, порнография (даже с NSFW).
III.2) Жесть.
За нарушение I - предупреждение
За нарушение II - предупреждение и перемещение поста в общую ленту
За нарушение III - бан