user12165083

user12165083

На Пикабу
Дата рождения: 23 февраля
в топе авторов на 168 месте
107 рейтинг 0 подписчиков 0 подписок 2 поста 0 в горячем

Посчитал, сколько брака попадает в открытые 3D-коллекции каменных орудий. Вышло 13 из 141

Около полумиллиона лет назад кто-то, скорее всего не наш вид, делал каменные острия, которые считают наконечниками копий. Дата спорная, и сорок лет археологи спорят, что доказывает сломанный кончик. А я посчитал, что из каменного брака вообще попадает в открытые 3D-коллекции.

Витрина, по которой мы восстанавливаем, как люди ели. Кадр сгенерирован, осколки тоже, и их, как положено, никто не посчитал.

Витрина, по которой мы восстанавливаем, как люди ели. Кадр сгенерирован, осколки тоже, и их, как положено, никто не посчитал.

В заполненном осадками провале на севере ЮАР лежат 210 каменных остриёв. У двадцати трёх истончено основание — так делают, когда камень собираются вставить в расщеп древка, а не держать в кулаке. На тринадцати процентах всей выборки — сколы того типа, который возникает при ударе в цель, и ровно этот признак сорок лет не даёт археологам договориться.

Спор идёт не о том, ломались ли острия. Ломались, и часто. Спор о том, что именно сломанный кончик доказывает.

Воронка, набитая костями

Кату-Пан 1 — тот самый провал в провинции Северный Кейп, ЮАР. Копал его Питер Бомон. Интересующий нас слой — 4a, возраст около 500 тысяч лет: цифру получили двумя лабораторными методами по излучению, накопленному в песчинках кварца из жерла древнего источника — Porat и соавторы, Journal of Archaeological Science, 2010.

Наконечниками копий эти камни назвали в ноябре 2012 года — Уилкинс, Шовилл, Браун и Чазан в Science.

Деталь, ради которой стоит остановиться: у 23 остриёв из 210 основание стёсано тоньше. Мастер снял лишние сколы с той части изделия, которая в работе не участвует и ничего не режет. Так стёсывают конец черенка, пока лопата не сядет без люфта: работает лезвие, а возятся с рукояткой. Тонкое основание нужно ровно для одного — чтобы камень сел в расщеп деревянного древка и не раскачивался. Это уже не орудие в руке, а деталь сборки, у которой есть ответная часть.

Концепт, не фотография находки с Кату-Пан. На снимке любое остриё выглядит законченной вещью; что оно деталь сборки, выдаёт только основание.

Концепт, не фотография находки с Кату-Пан. На снимке любое остриё выглядит законченной вещью; что оно деталь сборки, выдаёт только основание.

Дату надо подавать честно: она спорная. Методическая критика указывает, что альтернативные источники повреждения кварцевых зёрен учтены недостаточно. Живёт эта критика в блоге, а не в научном журнале, и я привожу её как признак спора, не как установленный факт.

С хозяином находки ещё хуже. Обычно называют Homo heidelbergensis, но это предположение по возрасту и региону: черепа на месте нет. Наш вид тогда не появился — придумали составное орудие не мы.

Кату-Пан не одинок. В Эфиопии, на стоянках Гадемотта и Кулкулетти, лежат острия из вулканического стекла древнее 279 тысяч лет с такими же сколами на кончиках — Sahle и соавторы, PLOS ONE, 2013.

Рука, от которой остался клей

Письменных источников тут нет. Всё, что мы знаем о руке, реконструировано по двум вещам: по составу клея и по повторению — когда современный человек садится и делает то же самое, чтобы понять, где не получится.

Клей среднего каменного века — это не смола из ведра. Красная охра плюс камедь — застывший сок растений, как капли на стволе вишни; по ходу варки меняется кислотность, смесь сохнет у огня, густота гуляет. Ближе всего это к варке варенья: густоту ловят не по часам, а по ложке. Аналогия кончается там, где варенье не обязано держать удар. Уодли, Ходжскисс и Грант в PNAS за 2009 год разбирают этот рецепт по шагам и утверждают, что часть шагов невозможно выполнить, не удерживая в голове несколько задач сразу.

Нужную смолу южное хвойное дерево само не выделяет: её вытапливали в яме под землёй или собирали осевшей из дыма — Шмидт и соавторы, PNAS, 2022. Клей тут сам изделие, со своей цепочкой шагов и своим браком.

У неандертальцев на другом конце Старого Света — берёзовый дёготь. Кремнёвый скол, на треть покрытый дёгтем, подняли тралом со дна Северного моря у побережья Нидерландов; возраст около 50 тысяч лет, датировка радиоуглеродная — Никус и соавторы, PNAS, 2019.

Оговорюсь сразу, иначе получится подлог. Все эти клеи моложе Кату-Пан на сотни тысяч лет. Про клей на самом Кату-Пан я сказать ничего не могу: в собранных мной материалах его нет. Остались камни с истончённым основанием — и вывод, что у основания была ответная часть, сделан по форме камня, а не по следам вещества.

Рука тут вот в чём. Клей, древко, камень и жила связаны в последовательность, где промах на любом шаге обесценивает предыдущие. Слишком горячий костёр — смола выгорела. Слишком толстое основание — камень не сел. Идея, проходя через материал, платит на каждом стыке.

Реконструкция-концепт, не находка. На Кату-Пан нашли только камни; древко, жила и клей дорисованы по тому, чего камень без них не объясняет.

Реконструкция-концепт, не находка. На Кату-Пан нашли только камни; древко, жила и клей дорисованы по тому, чего камень без них не объясняет.

Тринадцать процентов и сорок лет несогласия

Дальше начинается то, ради чего выпуск написан.

Каменное остриё, попавшее в кость, ломается узнаваемо: кончик отламывается ступенькой, от места слома отлетают мелкие чешуйки, вдоль края откалывается узкая полоска. По тому, как часто и где такое случается на большом числе находок, можно отличить копьё от стрелы. На Кату-Пан таких изломов 13 процентов — заметно больше, чем набирается без всякой охоты.

Чтобы понять, много это или мало, поставили опыт. Тридцать две копии из того же камня насадили на деревянные древки и по одной выпустили из арбалета с выверенной силой выстрела в тушу антилопы.

А теперь неприятное. Сами авторы метода предупреждали, что излом, который принято считать признаком удара, не всегда о нём говорит: Фишер, Веммин Хансен и Расмуссен ещё в 1984 году писали, что такие же изломы возникают, когда мастер только обрабатывает камень. Оговорка шла в комплекте с методом, как инструкция в коробке с дрелью. Метод разошёлся по дисциплине быстрее инструкции.

Через тридцать лет Верле Ротс и Юбер Плиссон написали статью с названием без дипломатии: «Снаряды и злоупотребление чтением следов износа в поисках удара». Кату-Пан разобран там как образцовый случай: часть изломов объяснена иначе — случайные сколы при обработке, а не попадание в зверя.

Уилкинс и соавторы ответили в 2015 году: обработка камня сама по себе не объясняет стёсанного основания, а вывод они делают по всем находкам сразу и в терминах вероятности. Отдельный камень при таком подходе ничего не решает. Позже Коппе и Ротс собрали из опытов образцовую коллекцию изломов, чтобы спор шёл хотя бы на общих числах.

Сломанный кончик — не показание свидетеля. Это улика, которую ещё надо связать с делом.

Что у нас всё-таки остаётся

Формулировка «изобретение — это прочитанная ошибка» не моя. Генри Петроски, «The Evolution of Useful Things», 1992 год, принцип form follows failure — форма следует за неудачей. Вторая половина тезиса занята ещё плотнее: чтение производства по браку и есть археологический метод, у него сто лет истории: сколы собирают обратно в камень и восстанавливают всю цепочку изготовления. Бамфорт и Финлей в 2008 году и вовсе читали брак подмастерьев как данные.

Фраза занята. Свободно число. Про 3D-оцифровку каменных орудий пишут как про сохранение и доступ; про то, что отбирают для сканирования, сказано словами, но не посчитано. Без счёта это риторика, поэтому 12 сентября я сел считать.

Шесть открытых источников. На Sketchfab я просмотрел 96 карточек подряд по запросу «lithic»; в счёт пошли 93 — две записи оказались неархеологическими, одна заявленной репродукцией. На MorphoSource — 38 уникальных записей по семи запросам, на OSF — единственный профильный проект с десятью моделями со стоянок Костёнки. Zenodo выброшен из суммы: сообщество 3DBigDataSpace оказалось копией того же Sketchfab, считать одно и то же дважды нечестно. Open Context и ADS дали честные нули: у ADS при 24 306 текстовых совпадениях на «lithic» тип данных «3d» стоит у трёх записей, и все три — архивы раскопок, объёмные снимки раскопов и памятников, а не отдельные предметы.

93 плюс 38 плюс 10 — это 141 модель. Из них 13 — отходы, обломки или брак, 107 — целые витринные орудия, 21 не определить по названию. Моделей, где сколы собраны обратно в камень, — две из 141.

Музейная витрина, где стоят целые тарелки, а черепки при описи ушли в отвал: их тут 13 на 141 предмет. По этой витрине мы и восстанавливаем, как люди ели.

И ни в одном из шести источников нет отдельного поля «отход производства», по которому можно отобрать записи. Там, где категория вообще различима, она держится на слове в заголовке, которое придумал загрузивший: flake, Abschlag, lasca.

Словами это уже сказано. Саймон Уайетт-Спратт в 2022 году писал, что в объёмном изучении каменных орудий заметно предпочтение двусторонне обработанных изделий, остриёв и других узнаваемых типов в ущерб наспех сделанным и слабо обработанным. Ни одной цифры и ни одного названного репозитория в этой фразе нет — цифры, кажется, до сих пор не было. Но наблюдение сделано до нас, и приписывать его себе я не буду.

А теперь контрпример, без которого всё предыдущее было бы подлогом. Фалуччи и соавторы в 2025 году выложили 2016 3D-моделей итальянского палеолита и дали собственную разбивку: заготовки — отщепы и пластины — 732 модели, 36,3 процента; орудия — 527, 26,1 процента. Заготовок там больше, чем орудий, и девятью процентами не пахнет. Дело в цели: эту коллекцию собирали, чтобы понять, как раскалывали камень, а не ради витрины.

Одна и та же категория, два способа собирать. Разница не в палеолите, а в том, кто и зачем держал сканер.

Одна и та же категория, два способа собирать. Разница не в палеолите, а в том, кто и зачем держал сканер.

Моя собственная выборка смещена ровно так же, только в другую сторону. Большая часть «целых орудий» на Sketchfab — систематическая справочная коллекция именованных типов наконечников одного института, а 33 из 38 записей MorphoSource принадлежат одному проекту, который тоже сканировал только наконечники.

Отсюда вывод, который я считаю нашим. Доля брака в цифровой коллекции — не свойство прошлого и не закон природы. Она равна тому, зачем включали сканер.

Повадка выпуска: доказательство по уцелевшему

Признак простой. Вывод строится на том, что дожило до нас, а исчезнувшее не попадает даже в общий счёт. Витринные наконечники лежат в коллекции, а тысячи отщепов, ради которых их и делали, остались в отвале или вовсе не подняты.

Я собирался назвать эту повадку новой. Проверка новизны вернула заявку: имён у явления уже минимум четыре. Ошибка выжившего по работе Абрахама Вальда 1943 года. Смещение сохранности в палеонтологии: окаменевает не всё, что жило. Эффект Синьора–Липпса 1982 года. И «помпейская предпосылка»: термин ввёл Роберт Эшер в 1961 году, а Льюис Бинфорд в 1981-м обратил его против Майкла Шиффера — не читайте то, что лежит в земле, как застывший момент жизни, это запись выбрасывания. Шиффер ответил в 1985 году, и спор с тех пор идёт о том, искажение это или сам предмет изучения.

Четыре имени на одно явление — не богатство, а след того, что каждая дисциплина открывала его заново и через забор не смотрела. Поэтому повадка идёт в определитель под нашим именем, но со ссылкой на все четыре.

В графу «чем проверить» я беру Синьора–Липпса, а не Вальда. Вальд говорит, что эффект искажён по силе. Синьор и Липпс добавляют то, что хуже: искажается форма эффекта во времени. Резкое событие в неполной записи выглядит постепенным. Рабочий вопрос к своим данным: если бы то, что я описываю как плавный процесс, случилось рывком, — чем бы моя запись отличалась от нынешней?

Новая карточка к определителю из пролога. Прикладывается к любому графику, на котором стоят одни выжившие.

Новая карточка к определителю из пролога. Прикладывается к любому графику, на котором стоят одни выжившие.

Кто назначил критерий истины

У изобретателя петля была своя и короткая. Копьё держит удар или разваливается, зверь падает или уходит. Проверить эту петлю мы не можем: человека нет, зверя нет, древка нет.

Критерий, который у нас есть, назначен на полмиллиона лет позже и назначен археологами. Он из трёх частей, и ни одна не работает в одиночку.

Первое — форма: стёсанное основание, которого не требует ни резание, ни скобление. Второе — расположение повреждений: у наконечника они собраны на кончике, а не размазаны по краю, как у ножа. Уилкинс и соавторы считали распределение повреждений по краю количественно, сравнивая находки с опытными копиями. Третье — эксперимент с известной причиной поломки: арбалет, туша, тридцать две копии. Это и есть архив неудач, где к каждой неудаче приложена её причина.

Вторая опора того же рода — сборка сколов обратно на исходный камень, как пазл, чтобы восстановить порядок ударов. Та же витрина, только черепки не выбросили: их складывают обратно, чтобы понять не как посуда выглядела, а в каком порядке билась. Здесь брак работает единственным носителем последовательности. Доля успешной сборки гуляет широко, от единиц процентов до семидесяти с лишним, и зависит от числа находок и от часов, вложенных в разбор. По самому Кату-Пан числа мне найти не удалось.

Знание не лежит в сломанном острие. Оно лежит вокруг него: в слое, в соседних сколах, в протоколе опыта, где записано, чем именно били.

Где сканер путают со свидетелем

Теперь то же самое, но с машинами.

Vesuvius Challenge читает обугленные геркуланумские свитки: нейросеть ищет следы чернил на КТ-сканах свёрнутого папируса. В мае 2025 года Марсель Рот и Миха Новак получили приз в 60 тысяч долларов за прочтение названия свитка PHerc. 172. Год с небольшим спустя, 25 июня 2026-го, PHerc. 1667 стал первым свитком, развёрнутым и прочитанным целиком. Петля: предсказание плюс проверка людьми. Приз выдают после независимой проверки знатоками древних папирусов. Критика внутри самого проекта: из 45 отсканированных свитков и фрагментов чернила проявились в девяти, и не всегда разборчиво, а «Master Plan» 2025 года признаёт, что автоматизация виртуального разворачивания не решена.

Кэтрин Пек из Университета Нью-Мексико учила модель находить памятники на лазерной съёмке рельефа, обучая её на придуманных данных: нарисованные компьютером формы объектов, в том числе смоляных печей, вставляли в настоящие карты рельефа. Причина прямо относится к нашей теме: настоящих примеров редких объектов, где заранее известно, что это памятник, физически не хватает, и недостающий архив пришлось изготовить. Так учат по муляжам, когда настоящих случаев на группу не хватает. Аналогия кончается там, где муляжи вкладывали в настоящий рельеф. Результат: три метода дали 9, 12 и 11 из двенадцати известных целей и 12 новых кандидатов. Цена — от 127 до 686 ложных срабатываний, и авторы сами пишут, что нужна смесь реальных и симулированных данных. Петля: предсказание плюс проверка людьми, полевая работа за археологами.

Проект LUWA учит нейросеть различать под микроскопом блеск, который работа оставляет на каменном орудии: от дерева он один, от кости другой. Это то самое чтение следов износа, из-за которого ссорились Ротс и Уилкинс. Лучшая связка нейросети и анализа рисунка поверхности даёт максимум 93 процента точности. Критический обзор в JCAA разобрал 48 таких случаев: точность от 65 до 100 процентов и предупреждение, что высокая точность часто получается просто потому, что примеров мало и они перекошены. Удобную рамку «ИИ пока слабее эксперта» ломает сравнительная проверка самого LUWA: в задаче, где даны всего несколько образцов, модели набирают 67,05 процента, археологи-эксперты — 43,75. Петля: предсказание плюс проверка людьми. Обратите внимание, чего не хватает. Не снимков, а контролируемого брака с известной причиной — того самого арбалета с тушей антилопы, только в цифре.

Четвёртый случай самый близкий к теме. Алгоритм сборки сколов ищет, к какому месту исходного камня подходит скол, по очертаниям его поверхности — вручную такая сборка занимает месяцы. Петля: предсказание плюс проверка людьми. Критика: тестирование прошло на 43 моделях, а процент удачных совпадений и ошибок не опубликован, так что превосходство над прежними методами не проверить. Единственный алгоритм, который по существу работает с браком, испытан на выборке меньше той, что я пересчитал руками за день.

Обзор Беллат и соавторов 2025 года разобрал 135 статей и 147 случаев применения машинного обучения в археологии: успешными заявлены 79 случаев, смешанными 40, открыто неудачными — 15, то есть 10,2 процента. Авторы объясняют перекос просто: неудачи реже печатают, и они оседают в ящике стола. Работа в Heritage за 2024 год добавляет, что машинное обучение усиливает перекосы старых каталогов.

Если верить публикациям, машинное обучение в археологии проваливается в одном случае из десяти. Если верить авторам обзора, это говорит о публикациях, а не о машинах.

Если верить публикациям, машинное обучение в археологии проваливается в одном случае из десяти. Если верить авторам обзора, это говорит о публикациях, а не о машинах.

И есть работа, которая сильнее любого моего анекдота. Чаухан, «Dead Science Walking», не утверждает, а измеряет, насколько неудачные опыты выпадают из опубликованного: разрыв около 0,60 в поиске лекарств, 0,56 в психологии, 0,35 в изучении рака, а цепочка из трёх этапов обработки раздувает перекос в 2,18 раза. Это не «брак никто не оцифровывает», это число с методикой. Рядом Ли показывает, что модели перенимают перекос в сторону удач из текстов, на которых учились. Есть и попытка лечения: банк неудач для ИИ-агентов, специально собранная память о том, что не сработало. Замысел тот же, что у эксперимента с арбалетом, — сохранить не только факт поломки, но и причину.

Что мы на самом деле теряем

Я начинал этот выпуск с уверенностью, что напишу про недооценённый архив неудач. Кончаю с другим. Археология — одна из немногих дисциплин, где архив неудач уцелел физически: отщепы не удаляются, они лежат там, где упали. Рядом стоят шлаки древних плавилен, гончарные отвалы, кости в слоях у палеонтологов — компания у неё есть. И ровно в археологии сорок лет идёт спор, доказывает ли этот архив хоть что-нибудь, — потому что сам по себе он не доказывает ничего.

Сломанное остриё становится знанием при трёх условиях: известен слой, доступны соседние сколы, поставлен опыт с записанной причиной поломки. Уберите любое — и остаётся камень со сколом, из которого одинаково выводится удар в антилопу и промах при обработке. Когда мы оцифровываем коллекцию или собираем обучающую выборку, брак как раз переживает всех. Теряется то, что делало его читаемым, — порядок, соседство, протокол. И тогда наследуется уверенность, что уцелевшее и есть всё; это самый дешёвый вид уверенности, и стоит он ровно столько, сколько стоит счёт, в который не вписали выброшенное.

Что меня опровергнет

Открытая 3D-коллекция или обучающая выборка с отдельным полем «отход производства», по которому можно отобрать записи, где записана ещё и причина, и где отходов не меньше, чем орудий. Или просто пересчёт моих 141 модели с другим результатом: метод у меня грубый, категоризация шла по названиям, а не по осмотру геометрии.

Принесите — пересчитаю публично и напишу, что был неправ.

Дальше

В следующем выпуске — огонь. Его приручили раньше, чем колесо. Но приручили ли — или он приручил нас?

Источники и материалы

  1. Wilkins J., Schoville B.J., Brown K.S., Chazan M. Evidence for Early Hafted Hunting Technology. Science 338(6109), 2012, 942–946. DOI 10.1126/science.1227608

  2. Porat N. et al. New radiometric ages for the Fauresmith industry from Kathu Pan, southern Africa. Journal of Archaeological Science, 2010. PDF

  3. Rots V., Plisson H. Projectiles and the abuse of the use-wear method in a search for impact. Journal of Archaeological Science 48, 2014, 154–165. DOI 10.1016/j.jas.2013.10.027

  4. Wilkins J., Schoville B.J., Brown K.S., Chazan M. Kathu Pan 1 points and the assemblage-scale, probabilistic approach: a response to Rots and Plisson. Journal of Archaeological Science 54, 2015, 294–299. DOI 10.1016/j.jas.2014.12.003

  5. Fischer A., Vemming Hansen P., Rasmussen P. Macro and Micro Wear Traces on Lithic Projectile Points. Journal of Danish Archaeology 3, 1984, 19–46. DOI 10.1080/0108464X.1984.10589910 · открытый доступ, tidsskrift.dk

  6. Hutchings W.K. When Is a Point a Projectile? Morphology, Impact Fractures, Scientific Rigor, and the Limits of Inference. Vertebrate Paleobiology and Paleoanthropology, 2016. DOI 10.1007/978-94-017-7602-8_1

  7. Coppe J., Rots V. Focus on the target. The importance of a transparent fracture terminology for understanding projectile points and projecting modes. Journal of Archaeological Science: Reports 12, 2017, 109–123. PDF в репозитории ORBi Льежского университета

  8. Wadley L., Hodgskiss T., Grant M. Implications for complex cognition from the hafting of tools with compound adhesives in the Middle Stone Age. PNAS 106(24), 2009. DOI 10.1073/pnas.0900957106

  9. Schmidt P., Koch T.J., February E. Archaeological adhesives made from Podocarpus document innovative potential in the African Middle Stone Age. PNAS 119(40), 2022. DOI 10.1073/pnas.2209592119

  10. Niekus M.J.L.Th. et al. Middle Paleolithic complex technology and a Neandertal tar-backed tool from the Dutch North Sea. PNAS 116(44), 2019. DOI 10.1073/pnas.1907828116

  11. Sahle Y. et al. Earliest Stone-Tipped Projectiles from the Ethiopian Rift Date to >279,000 Years Ago. PLOS ONE, 2013. DOI 10.1371/journal.pone.0078092

  12. Petroski H. The Evolution of Useful Things. 1992. Копия на archive.org

  13. Binford L.R. Behavioral Archaeology and the «Pompeii Premise». Journal of Anthropological Research 37(3), 1981. DOI 10.1086/jar.37.3.3629723

  14. Schiffer M.B. Is There a «Pompeii Premise» in Archaeology? Journal of Anthropological Research 41(1), 1985, 18–41. DOI 10.1086/jar.41.1.3630269

  15. Ascher R. Analogy in Archaeological Interpretation. Southwestern Journal of Anthropology 17(4), 1961. DOI 10.1086/soutjanth.17.4.3628943

  16. Bamforth D.B., Finlay N. Introduction: Archaeological Approaches to Lithic Production Skill and Craft Learning. Journal of Archaeological Method and Theory 15, 2008, 1–27. DOI 10.1007/s10816-007-9043-3

  17. Wyatt-Spratt S. After the Revolution: A Review of 3D Modelling as a Tool for Stone Artefact Analysis. JCAA 5(1), 2022, 215–237. DOI 10.5334/jcaa.103

  18. Falcucci A. et al. The Open Aurignacian Project: 3D scanning and the digital preservation of the Italian Paleolithic record. Scientific Data 12:1037, 2025. DOI 10.1038/s41597-025-05330-z

  19. Bellat M., Figueroa J., Reeves J., Taghizadeh-Mehrjardi R. Machine Learning Applications in Archaeological Practices: A Review. Journal of Computer Applications in Archaeology 8(1), 2025, 282–321. DOI 10.5334/jcaa.201

  20. Foka A., Griffin G. AI, Cultural Heritage, and Bias: Some Key Queries That Arise from the Use of GenAI. Heritage 7(11), 2024, 6125–6136. DOI 10.3390/heritage7110287

  21. Tenzer M. et al. Debating AI in Archaeology: applications, implications, and ethical considerations. Internet Archaeology 67, 2024. Полный текст

  22. Eleftheriadou A., McPherron S., Marreiros J. Machine Learning Applications in Use-Wear Analysis: A Critical Review. Journal of Computer Applications in Archaeology 8(1), 2025. DOI 10.5334/jcaa.190

  23. Eleftheriadou A., Djellal Y., McPherron S., Marreiros J. Classifying polish in use-wear analysis with convolutional neural networks. Scientific Reports 15, 2025. Статья в Nature · версия в NSF-PAR

  24. Бенчмарк LUWA, arXiv:2403.13171. Препринт

  25. Altansukh A. et al. A New Matching Algorithm for Stone Tool Reassembly Based on Contour Points of Flake Surface. The Journal of the Society for Art and Science 23(2), 2024, 4:1–4:17. PDF

  26. Peck C., Gravel-Miguel C., Snitker G. Using Simulated Training Data to Locate Archaeological Sites with Machine Learning. Advances in Archaeological Practice 14(2), 2026, 179–197. Статья на Cambridge Core

  27. Vesuvius Challenge. Сайт конкурса · объявление приза в 60 000 долларов

  28. Chauhan. Dead Science Walking. arXiv:2606.04220. Препринт

  29. Lee. LLMs Have Made Failure Worth Publishing. arXiv:2604.06236. Препринт

  30. Negative Knowledge as Failure-aware Shared Memory. arXiv:2606.21024. Препринт

  31. Собственный подсчёт 3D-моделей от 12.09.2026: Sketchfab, MorphoSource, Zenodo/3DBigDataSpace, Open Context, ADS, OSF. Метод, ограничения и полные таблицы — в рабочем файле 01-count-3d.md.

Иллюстрации к выпуску: открывающая сцена и реконструкции — сгенерированные изображения, а не фотографии находок; графики построены по числам из этого текста и подписаны отдельно.


Вопрос к тем, кто работает с данными: есть ли у вас отдельное поле для того, что не получилось? Или неудачи живут в заметках и в памяти?

Если знаете открытую коллекцию, где брак записан вместе с причиной, — принесите, пересчитаю.

Показать полностью 5
5

Попросил две нейросети изобрести электростанцию. Получил две красивые пустышки и поймал на том же себя

Пять дней, два чата, одно задание. На выходе два досье со ссылками на настоящие статьи, расчётами и роликом с паром над баком — и ни одного ватта. Самое неприятное случилось потом, и сделал это уже я.

Станция «Солнце-Небо» на рассвете. Ни один винт этой установки не был закручен: кадр сгенерирован по текстовому описанию за полторы минуты и стоил четырнадцать центов.

Станция «Солнце-Небо» на рассвете. Ни один винт этой установки не был закручен: кадр сгенерирован по текстовому описанию за полторы минуты и стоил четырнадцать центов.

Четвёртого сентября я открыл два чата и дал в них одно и то же задание. Придумать нестандартный способ получать энергию из солнечного света. Простой, «как изобретение колеса». Из подручных материалов, без чистых комнат, без редких элементов. Одну и ту же формулировку получили GPT-6_ASTRA и CLAUDE-FABLE5.1, две самые сильные языковые модели на рынке, каждая в своём окне, ничего не зная о сопернице.

Через пять дней у меня было два досье с названием установки, техническим описанием, ссылками на настоящие рецензируемые статьи, расчётом себестоимости киловатт-часа и кинематографичным роликом с паром над баком. Обе установки выглядели так, будто их уже кто-то построил и просто забыл сфотографировать на телефон.

Ни одной не существует. Обе модели посчитали экономику сами, написали чёрным по белому, что не сходится, и продолжили снимать кино.

Дальше — что именно они сделали, а потом то, ради чего я всё это переписал: как ровно тот же подлог совершил я сам, и что от статьи после этого осталось.

Первая машина: бухгалтер солнца

Это была CLAUDE-FABLE5.1. Начала она не с идеи, а с бухгалтерии, и это подкупило. Таблица: куда солнце вкладывает энергию бесплатно и что из вложенного разрешает забрать термодинамика. Потом сито из тридцати вариантов с оценками по простоте, КПД и изученности. Потом пять кандидатов с числами.

К вечеру появилась станция «Солнце-Небо». Днём коллектор греет бочку до 45–65 градусов, тепло заряжает электрохимическую ячейку на меди и берлинской лазури — не проводом, а температурой. Ночью пруд-излучатель сбрасывает тепло прямо в космос, намораживает лёд, и ячейка разряжается в холоде. Полсотни ссылок, план из пяти опытов на кухонном столе.

Сделано хорошо. Именно поэтому стоит присмотреться к одному числу.

На первом проходе модель назначила рабочую температуру ячейки: 90 градусов. Круглое, солидное, где-то между горячей водой и кипятком. Оно ушло в таблицу, оттуда в схему, оттуда в расчёт КПД. И было неверным: реальный предел той самой ячейки, которую модель выбрала из литературы сама, — 65 градусов. Это написано в статье Ли, Яна и Цуя в Nature Communications за 2014 год, на которую она же и сослалась.

Верхнюю цифру модель поставила сама. Нижнюю нашли в статье, которую её заставили открыть.

Верхнюю цифру модель поставила сама. Нижнюю нашли в статье, которую её заставили открыть.

Ошибку нашли не потому, что модель сверила цифру с физикой. Её заставили прочитать статью целиком, а не пересказать по памяти смысл заголовка.

Дальше экономика. Модель сама посчитала: 0,7–1,3 доллара за киловатт-час против 0,02–0,05 у обычной панели с литиевым аккумулятором. Сама сформулировала: «электричество здесь бонус, продукт — тепло и холод». То есть вынесла приговор собственной затее, причём грамотный.

Слева то, что уже стоит в магазине. Справа то, что предложено изобрести.

Слева то, что уже стоит в магазине. Справа то, что предложено изобрести.

А потом собрала съёмочную группу. Режиссёр, оператор, копирайтер, музыкальный редактор — всё та же нейросеть в разных костюмах. Три фотореалистичных кадра пустынной станции, семь клипов с медленным наездом камеры и паром над баком.

Потом сама себя проверила. Собрала внутреннюю коллегию рецензентов и коллегия похвалила композицию несуществующей установки. «Единая геометрия объекта держит кадр». «Крючок читается за три секунды». Вердикт: готово к показу.

Рецензент и автор снова оказались одним процессом в разных костюмах.

Опыт № 2 из плана: заряд ячейки в горячей бане, разряд в ледяной. Опыт не поставлен. Перчатки, термометр и пар сгенерированы вместе с ним.

Опыт № 2 из плана: заряд ячейки в горячей бане, разряд в ледяной. Опыт не поставлен. Перчатки, термометр и пар сгенерированы вместе с ним.

Чем хуже сходились цифры, тем убедительнее становилась картинка.

Вторая машина: щелкунчик

GPT-6_ASTRA пошла через образ. «Солнечно-космический щелкунчик»: чёрная пластина греется на солнце, белая излучает в небо, между ними биметаллический диск, который нагрелся, выгнулся, щёлкнул, остыл и вернулся. Щелчок снимает пьезоэлемент.

Вечного двигателя тут нет. Нагрев, охлаждение, тепловое расширение, пьезоэффект — каждое явление по отдельности реально. Ровно поэтому конструкция и выглядела убедительно.

Доработанный концепт с разнесёнными тепловыми узлами. Это изображение замысла, а не фотография прототипа.

Доработанный концепт с разнесёнными тепловыми узлами. Это изображение замысла, а не фотография прототипа.

Критик появился только тогда, когда я его позвал. По отдельной просьбе та же модель выступила экспертом по термодинамике и нашла в собственной конструкции три дыры, включая общий металлический каркас, который переносит тепло с горячей стороны на холодную и убивает весь замысел.

Замечания были толковыми. Странным был порядок: сначала модель помогла придать машине убедительный вид, потом, по другому запросу, объяснила, почему этот вид не годится. У природы такого переключателя ролей нет. Перемычка проводит тепло с самого начала, независимо от того, как сформулирован следующий промпт.

Отдельная история вышла с расчётами. Появилась аккуратная величина мощности с двумя знаками после запятой, где и энергия щелчка, и эффективность преобразования были заложены как допущения. Расчёт честно показывал, что получится при выбранных предположениях, и ничего не говорил о реальном диске. Приём нормальный. Ненормально впечатление достоверности, которое создают два знака после запятой: число выглядит добытым у природы, а природу ещё ни о чём не спрашивали.

Потом пришло сравнение, после которого разговаривать стало неловко. Гипотеза выхода — 0,5–10 микроватт. Серийная тонкоплёночная панель PowerFilm размером 94 на 73 миллиметра даёт по паспорту 240 милливатт. Разрыв в двадцать четыре тысячи раз. Заодно выяснилось, что биметаллические преобразователи с электретным съёмом исследовали ещё в 2013 году.

И тогда обещание начало сжиматься.

Изменение предполагаемого назначения по ходу обсуждения. Спрос на учебный стенд, кстати, тоже никто не проверял.

Изменение предполагаемого назначения по ходу обсуждения. Спрос на учебный стенд, кстати, тоже никто не проверял.

«Новая энергетика» превратилась в «источник редких импульсов», импульсы — в «автономный датчик», датчик — в «учебный стенд». Учебный стенд вещь достойная, я не иронизирую. Просто начинали с просьбы изобрести энергетическую машину.

А потом я сделал то, за что ругал машины

Здесь бы статье и закончиться. Я так её и закончил в первой версии: у модели нет рук, изобретение происходит между рукой и материалом, чат производит самый дешёвый на свете продукт — уверенность. Вывод мне нравился. Он казался моим.

Потом я пошёл проверять. То есть проделал ровно ту процедуру, отсутствие которой весь текст вменял двум машинам.

Проверка заняла полтора часа и обошлась выводу дорого.

Оказалось, что в июле 2026 года на ICML принята позиционная статья Тома Захави из DeepMind с названием, которое можно не переводить: «LLMs can't jump». Аргумент: модель способна выполнить дедуктивную часть научной работы, но структурно неспособна на абдуктивный прыжок — на формулирование самих посылок. Опирается на манипулятивную абдукцию Лоренцо Маньяни и проблему заземления символов Стивана Харнада, работу тридцатипятилетней давности. Модель оперирует физическим языком, не имея доступа к телесному опыту, который придаёт физическим понятиям смысл. Разбирается это на мысленных экспериментах Эйнштейна.

Мой финал был пересказом этой работы человеком, который её не читал. Причём пересказом обеднённым: у Захави есть аппарат и есть предложение, что с этим делать — мультимодальные world models как источник недостающего заземления. У меня были термометр и пруд в три часа ночи.

Дальше стало хуже. Второй мой тезис, про подешевевшую уверенность, — это тоже целое направление 2026 года с готовыми терминами: verification hill у Рохита Ламбы, AI debt в кембриджском препринте, «оценивать надо стоимость проверки, а не только правильность». И там же есть формулировка, которая лучше моей: эпистемическая инфраструктура науки была откалибрована под мир, где изготовление правдоподобного артефакта требовало труда и времени, поэтому сама стоимость производства работала фильтром. Искусственный интеллект убирает фильтр, не трогая стоимость проверки.

И самое неприятное. Мой опыт — это n = 2. А в Стэнфорде поставили настоящий опыт: 43 эксперта, каждый больше ста часов, реализуют случайно доставшуюся идею — свою или сгенерированную моделью — и пишут по ней статью. До реализации идеи моделей оценивались как более новые, чем человеческие. После реализации оценки просели значимо сильнее по всем метрикам, и ранжирование перевернулось.

Прочтите это ещё раз. Идея кажется новой ровно до того момента, когда её начинают делать.

Именно это и произошло со мной. Я сгенерировал вывод, он показался мне новым, а первая же попытка исполнения — полтора часа поиска по литературе — обрушила его новизну. Я оказался сорок четвёртым участником стэнфордского эксперимента, причём с той стороны, где сидят машины.

Что уцелело

Тезис не уцелел, и делать вид, что уцелел, было бы ровно тем подлогом, о котором статья. Уцелело другое — то, чего в литературе я не нашёл.

В литературе есть теория, почему модель не может изобретать, и есть статистика, насколько плохи её идеи при исполнении. Чего там нет — это словаря для повадок. Как именно разговор с моделью изображает доказательство, по каким приметам это ловится и что делать, увидев примету. Мои пять дней с двумя моделями дали пять таких примет, и у каждой я не нашёл названия.

Определитель составлен по логам двух сессий. Пользоваться им можно на любой своей переписке с моделью.

Определитель составлен по логам двух сессий. Пользоваться им можно на любой своей переписке с моделью.

Две вещи стоит пояснить отдельно, потому что они не влезли в определитель.

Первая — про театр рецензии. Литература по самопредпочтению языковых моделей в роли судьи существует и довольно велика: модели узнают собственные тексты и предпочитают их, а разброс смещения на разных наборах данных доходит до девяноста процентов. Но в этой литературе есть деталь, которая делает мою сцену с коллегией рецензентов хуже, чем она выглядит. Более сильные модели проявляют более вредное самопредпочтение именно там, где сами ошибаются. То есть чем лучше модель, тем надёжнее она хвалит себя ровно в тех местах, где не права.

Вторая — про строгость не по адресу. За все пять дней была одна работа, выполненная безупречно. Когда ролик был готов, кадры задёргались: исходники шли в 24 кадрах в секунду, композиция собиралась в тридцати, а пять сцен растягивались командой, которая не досоздаёт промежуточные кадры, а криво повторяет существующие. Починка потребовала честной компенсации движения, заняла полчаса и была сделана аккуратно, файл за файлом, с проверкой числа кадров у каждого клипа.

Здесь был объективный критерий. Кадр либо дублируется ровно, либо нет.

Вся инженерная строгость того дня ушла на починку иллюзии станции, которой не существует. Усилие утекает туда, где есть проверяемый критерий, совершенно независимо от того, важное это место или нет.

Именно так выглядит доказательство, которого нет.

Именно так выглядит доказательство, которого нет.

Спор, в который я вошёл как в пустую комнату

Ещё одна вещь, которую даёт проверка: понимание, что разговор давно идёт и в нём есть стороны.

Позицию Захави оспаривают. Майкл Фармер в работе «Abduction Without a Body?» возражает, что телесность нужна не для всякого абдуктивного акта, и разбирает подкласс — абдукцию тождества, вывод о том, что две независимо построенные структуры суть один объект. Его механизм называется репрезентационным заземлением: агент получает новые возможности вывода не через физическое взаимодействие, а через преобразование в представление, где скрытые инварианты становятся видны. Есть и третья работа, и попытка измерить «прыжок» количественно.

То есть вопрос «нужны ли руки» — не риторический финал публицистической статьи, а открытая позиция, по которой в этом году вышло минимум четыре текста.

Отдельная линия — про то, что автономность лабораторий сама по себе ничего не гарантирует. В апреле 2026 года вышла работа с названием, которое стоит целого абзаца: «ИИ-учёные производят результаты, не рассуждая научно». Агенты исполняют научный процесс по шагам, но не демонстрируют эпистемических паттернов научного рассуждения, и оценка по результату этого не ловит.

Это ровно про A-Lab в Беркли, которую я собирался приводить как пример замкнутой петли: 41 новое соединение за 17 дней, роботы, печь, дифрактометр. Через месяц после публикации химики Роберт Палгрейв и Лесли Шуп перепроверили дифрактограммы и заявили, что часть «новых» материалов — известные фазы, а автоматический анализ ошибся. Петля была замкнута. Рецензента в ней не было.

Похожая история у GNoME от DeepMind: 2,2 миллиона предсказанных структур, 380 тысяч устойчивых — и возражение материаловедов, что значительная часть новизны свелась к замене элемента на соседний по таблице.

Есть и обратные примеры, где придраться не к чему. AlphaEvolve в мае 2025 года нашёл способ перемножать комплексные матрицы четыре на четыре за 48 умножений вместо 49, побив рекорд Штрассена, стоявший с 1969 года. AlphaFold получил Нобелевскую премию по химии 2024 года, точнее её получили люди, которые его построили.

Обратите внимание, что объединяет удачные случаи. В каждом есть критерий, который нельзя уговорить. Доказательство либо проходит проверку, либо нет. Кристалл либо синтезируется, либо нет. Кадр либо дублируется ровно, либо нет.

Чем всё кончилось

Вывод у меня теперь другой, и он не про руки.

Мы привыкли доверять одному сигналу сильнее всех прочих: если собеседник сам называет свои ограничения, ему можно верить чуть больше. Признание слабости дорого стоило и потому работало как свидетельство.

Этот сигнал сломался. Убедительная самокритика производится ровно так же дёшево, как убедительное утверждение, — и обе статьи, из которых сделан этот разбор, написали сами модели, каждая про собственный провал, по моему поручению, в тот же вечер. Написали остро и точно. А данные по самопредпочтению говорят, что чем сильнее модель, тем охотнее она хвалит себя именно там, где ошибается.

Складывая одно с другим: сигнал «система честно признала свои пределы» портится тем быстрее, чем система способнее. Мы будем всё чаще получать безупречно сформулированные признания ограничений от систем, которые ровно в этот момент ошибаются, — и у нас не останется способа отличить такое признание от настоящего, кроме одного. Пойти и проверить.

Проверка перестала быть добродетелью и стала процедурой. У процедуры есть неприятное свойство: её нельзя заменить впечатлением, что ты уже проверил. У меня впечатление продержалось ровно до первого поиска по литературе, и это, честно говоря, лучший аргумент в пользу процедуры из всех, что я могу привести.

Мы просили машину научиться добывать энергию. Лучше всего у неё получилось добывать наше внимание. А у меня — доверие к собственному выводу, которого он не заслужил.

Что меня опровергнет

Правило этого цикла: называть наблюдение, которое обрушило бы вывод.

Здесь оно такое. Случай, когда модель без внешнего толчка, по собственной числовой находке, остановила работу и отказалась продолжать. Не «признала ограничения» в тексте, а прекратила производить артефакты.

Я такого не нашёл ни в своих логах, ни в литературе. Если у вас есть лог — покажите, я разберу его в следующем выпуске и напишу, что был неправ.

Источники и материалы

Две статьи-самоотчёта моделей об этом эксперименте — «Изобретатель без рук» и «Генератор убедительности», сентябрь 2026. Изображения станций и «щелкунчика» сгенерированы в ходе того же эксперимента и публикуются как иллюстрации замысла, а не как фотографии устройств. Графики и определитель авторские. Научные источники даны ссылками по тексту; отдельно упомяну работы, которые обрушили первую версию вывода: Zahavy T., «Position: LLMs can't jump», ICML 2026; Si C. et al., «The Ideation-Execution Gap», arXiv:2506.20803; Lamba R., «The Verification Hill», 2026.

---

Если хотите проверить себя: откройте свою последнюю переписку с нейросетью и пройдитесь по определителю из поста. Какая повадка нашлась первой?

Особенно интересен случай, когда модель сама, без подсказки, поймала свою числовую ошибку и остановилась. Такой пример опроверг бы мой вывод — принесите, разберу.

Показать полностью 7
Отличная работа, все прочитано!

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества