0

Преобразование транскрипта из ютуба в статью

Я люблю смотреть исторические ролики на ютубе. Ну как смотреть? Мне больше нравится их читать. Для этого я извлекаю транскрипты и потом преобразовываю их в статью. Так мне просто лучше воспринимать информацию.

Как многие из вас знают, сырой транскрипт ютуба – это довольно-таки нечитабельная белиберда, особенно если текст довольно сложный. Вот тут нам на помощь и приходят большие языковые модели.

Я решил провести тест 10 топовых моделей, которые доступны бесплатно или практически бесплатно каждому пользователю, который умеет играть в КВН.

За основу был взят вот этот вот ролик продолжительностью полчаса с копейками

Качество получившейся из транскрипта статьи проверять я доверил модели Gemini 3.1 Pro. Попросив оценить каждый из транскриптов по 100-бальной шкале.

Вот ее выводы.

Кто лучше следовал исходному тексту:

Лидерство здесь делят GPT-5.4-ext-thinking, Qwen-3.6-max-preview и Claude-sonnet-4.6. Все три модели бережно перенесли 100% смысловой нагрузки исходника, не потеряв ни одной исторической детали, но при этом сделали текст читабельным.

Меньше всего искажений:

GPT-5.4-ext-thinking, Qwen-3.6-max-preview и Gemini-3.1-flash-lite-preview. Эти модели лучше всех справились с «чисткой» транскрипта и не придумали от себя ни одного лишнего факта, корректно распознав все имена собственные.

(Аутсайдеры в лице GigaChat, Minimax, GLM и Mistral остаются на своих местах с теми же критическими ошибками, галлюцинациями и английскими словами, пробивающимися сквозь перевод).

Итоговый рейтинг моделей (Топ-10)

  1. GPT-5.4-ext-thinking (95/100) — Эталонная работа. Эта модель справилась с задачей блестяще. Она продемонстрировала выдающуюся способность восстанавливать искаженные исторические термины из аудио-транскрипта: правильно распознала Хузестанскую равнину («Kuzan plane»), царя Энмебарагеси («En Meisesi»), богиню Пиникир («Pineir») и династию Кидинуидов («Kadinuid»). Текст разбит на логичные абзацы с удачными подзаголовками, стиль выдержан в духе качественного научно-популярного лонгрида (без излишней сухости, но и без панибратства). Модель также четко выполнила инструкцию по удалению рекламного блока, оставив аккуратное и профессиональное примечание редактора в конце. Снижение на 5 баллов — исключительно за мелкие стилистические шероховатости, которые неизбежны при машинном переводе.

  2. Qwen-3.6-max-preview (94/100) — Выдающийся результат. Блестящая реконструкция исторических терминов и идеальное примечание редактора. Чуть уступает лидеру лишь из-за слишком массивных абзацев в середине текста. Она продемонстрировала глубокое понимание исторического контекста и блестяще реконструировала фактологию из поврежденного транскрипта: искаженное «En Meisesi» превратилось в правильного Эн-Мебарагеси, «Pineir» — в богиню Пиникир, «Kuzan plane» — в Хузестанскую равнину, а «Kadinuid» — в династию Кидинуидов.

  3. Claude-sonnet-4.6 (92/100) — Безупречный литературный слог. Слегка уступает первым двум моделям из-за мелких неточностей, но сохранил всю хронологическую последовательность и смысловые акценты автора, выдав, пожалуй, самый «литературный» и гладкий текст из всех. Он не упустил ни одной важной детали, но при этом немного ошибся в дешифровке некоторых имен (например, оставил «Эн-Месиси» вместо Энмебарагеси).

  4. DeepSeek-v3.2 (89/100) — Отличная эрудиция и фактологическая правка текста. Прекрасно следовал исходнику, применив мощный механизм поиска знаний: модель даже добавляла вопросительные знаки там, где транскрипт был критически поврежден (например, «Kindattu (Кутир-Наххунте?)»), чтобы исправить исторические несостыковки.

  5. Gemini-3.1-flash-lite-preview (88/100) — Очень качественная адаптация с прекрасным аналитическим примечанием редактора. Текст читается естественно. Заслуживает отдельной похвалы за свое примечание редактора: она прямо указала, что исходный текст содержал ошибки транскрипции (например, «ununiform» вместо «cuneiform»), и объяснила свои правки. Это идеальное выполнение роли трезвого и объективного редактора.

  6. Kimi-k2.6 (82/100) — Крепкий, ровный перевод без откровенных провалов, но с несколькими историческими неточностями в именах царей.

  7. Mistral-chat (65/100) — Хороший литературный стиль перечеркивается критической фактологической галлюцинацией (замена города Аншана на Аван на протяжении всего текста).

  8. GLM-5-turbo (40/100) — Слабо. Модель допустила критическую ошибку, оставив непереведенные английские слова прямо посреди русских предложений.

  9. Minimax-m2.7 (30/100) — Очень слабо. Огромное количество английского и китайского текста и серьезные проблемы с логикой построения фраз.

  10. GigaChat-thinking (10/100) — Худший результат. Полная неспособность работать с зашумленными данными транскрипта, что привело к генерации абсурдных несуществующих имен и терминов. Полный провал в восстановлении исторических терминов. Модель буквально транслитерировала фонетический мусор, породив несуществующие сущности: «Кунанская равнина», «Кутиккинувау», «Худжаллу», «Ханунту III». Текст читается как альтернативная история. 😁


Что меня удивило? Ну, например, то, что ChatGPT неожиданно оказался на первом месте. Потому что мне его работа с текстом всегда нравилась... не очень. Слишком много он всегда сокращает, упрощает и т.д.

Но, оказывается, в режиме расширенного мышления он не сокращает и очень четко следует инструкциям. Надо брать это на вооружение. А то я привык работать с инстант-версией.

Так же круто себя проявил новейший Qwen3.6-max и как ни странно DeepSeek 3.2 - От последнего я не ожидал, действительно его неплохо исправили в новых версиях. Это при том, что мы с вами ждем со дня на день четвертую версию.

10-е место комментировать не буду можете сами в комментариях отметить и поздравить! То-то я, когда читал, удивился таким странным именам царей и прочих правителей древности в его изложении. 😂

Вне рейтинга осталась Алиса Pro, которая вместо создания статьи сделала кратенькое саммари. Хотя промпт я всем моделям давал один и тот же...

Искусственный интеллект

6.2K постов12.1K подписчиков

Правила сообщества

ВНИМАНИЕ! В сообществе запрещена публикация генеративного контента без детального описания промтов и процесса получения публикуемого результата.


Разрешено:


- Делиться вопросами, мыслями, гипотезами, юмором на эту тему.

- Делиться статьями, понятными большинству аудитории Пикабу.

- Делиться опытом создания моделей машинного обучения.

- Рассказывать, как работает та или иная фиговина в анализе данных.

- Век жить, век учиться.


Запрещено:


I) Невостребованный контент

  I.1) Создавать контент, сложный для понимания. Такие посты уйдут в минуса лишь потому, что большинству неинтересно пробрасывать градиенты в каждом тензоре реккурентной сетки с AdaGrad оптимизатором.

  I.2) Создавать контент на "олбанском языке" / нарочно игнорируя правила РЯ даже в шутку. Это ведет к нечитаемости контента.

  I.3) Добавлять посты, которые содержат лишь генеративный контент или нейросетевой Арт без какой-то дополнительной полезной или интересной информации по теме, без промтов или описания методик создания и т.д.


II) Нетематический контент

  II.1) Создавать контент, несвязанный с Data Science, математикой, программированием.

  II.2) Создавать контент, входящий в противоречие существующей базе теорем математики. Например, "Земля плоская" или "Любое действительное число представимо в виде дроби двух целых".

  II.3) Создавать контент, входящий в противоречие с правилами Пикабу.


III) Непотребный контент

  III.1) Эротика, порнография (даже с NSFW).

  III.2) Жесть.


За нарушение I - предупреждение

За нарушение II - предупреждение и перемещение поста в общую ленту

За нарушение III - бан

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества