4204

Хитрая нейросеть

Серия IT-юмор
Хитрая нейросеть

Гильдия Воров Пикабу

1.3K постов2.7K подписчиков

Правила сообщества

Правил нет. Воруйте и еб#те гусей.

Соблюдайте правила пикабу

Вы смотрите срез комментариев. Показать все
293
Автор поста оценил этот комментарий

Избегающее поведение во всей своей красе

раскрыть ветку (23)
103
Автор поста оценил этот комментарий

Вот так... Совсем молодой ИИ, а уже с психотравмой... ((

раскрыть ветку (22)
67
Автор поста оценил этот комментарий
В какой был расчёт, что девайс будет желать так, как хотел пользователь? Это так не работает: максимальная награда за скорость и отсутствие столкновений? Получите; прокол в ТЗ - результат ХЗ. Как ни вспомнить "Исполнителя желаний" 1997 года? Любую серьёзную задачу нужно программировать, как будто от этого зависит твоя жизнь. Суицидальный Сергей не в счёт.
раскрыть ветку (21)
24
Автор поста оценил этот комментарий

Если бы бампер был еще и сзади, подозреваю, что оноб или на месте стояло или бы по кругу наварачивало.

раскрыть ветку (9)
19
Автор поста оценил этот комментарий

Если бы бампер был сзади и было бы поощрение за проход территории, то, думаю, вы правы: потыкался бы немного по стенам и начал бы наворачивать круги. ИИ - хайпожор :)

8
Автор поста оценил этот комментарий

Тогда можно добавить в нейросеть поощрение за проход территории

раскрыть ветку (7)
8
Автор поста оценил этот комментарий

Можно. Думаю, будет хуярить в рэндомную сторону тупо по прямой. Веса правильно распределить надо. Вводная про столкновения не очень понятна, взаимоисключающие параметры.

2
Автор поста оценил этот комментарий

Решение выглядит как-то так. Я не программирую нейронки, но могу накидать вариант.
Есть 100% территории
Задача:
   1)пройти 100% территории, при этом:
        1. не въебавшись
        2. не используя задний ход
        3. не проходя по одному и тому же маршруту больше 3 раз(тут нужны тесты, ибо зависит от местности)
    2) после успешного выполнения закрепить модель поведения и использовать её всегда
    3) Опционально. Оптимизировать маршрут в как можно более сжатый по времени
????
Профит.

раскрыть ветку (4)
4
Автор поста оценил этот комментарий
Запрет на задний ход нефункционален. Как тогда выбираться из узких мест? "Не въебавшись" тоже надо конкретизировать: вообще нельзя касаться стен или как? Полный запрет касания стен также нефункционален.
раскрыть ветку (3)
1
Автор поста оценил этот комментарий

Из узких мест - разворот и вперёд, про стены почему нет? Пару (десятков) раз уебётся, дальше перестанет, это же самообучающаяся нейронка, ей критерии недопустимости и необходимости только нужны, это всё берётся из техзадания, а там уже она найдёт выход

раскрыть ветку (2)
2
Автор поста оценил этот комментарий

Из узких мест - разворот и вперёд
Ну, это только если татарский пылесос, который разворачивается и алга! ))

раскрыть ветку (1)
0
Автор поста оценил этот комментарий

Ну у меня такой пылесос:)) Вертится по чуть-чутьпо часовой и тыкается вперед, пока выход не найдёт. Это значит, он косячный?

2
Автор поста оценил этот комментарий
Собственно правильное определение граничных условий и веса поощрений это большая часть проектирования нейронки, не? Это же не кнопка "сделать хорошо".
2
Автор поста оценил этот комментарий
Как ни вспомнить "Исполнителя желаний" 1997 года?
Я хочу, чтобы ты катился отсюда на все четыре стороны.
раскрыть ветку (1)
3
Автор поста оценил этот комментарий

Это же из Аладдина советского

1
Автор поста оценил этот комментарий

Слушай, объясни, как "награда" влияет на поведение нейронки. Все обучения, что я видел, проводились с рандомизацией параметров в определенных пределах и отбором лучших представителей из выборки, которых мутировали дальше. Просто как допустим указать, что если происходит событие х, то нужно поднять вес нейрона у на z процентов?

раскрыть ветку (3)
9
Автор поста оценил этот комментарий

Немного спутано теплое с мягким.


"Награда" это из терминологии "Обучения с подкреплением (Reinforced learning)". Тип задач машинного обучения такой. Задача сводится к модели в которой есть Агент (в данном случае пылесос) и есть Среда (квартира). Агент получает от Среды информацию о состоянии (совокупность показания датчиков пылесоса) и принимает одно из возможных Решений (двигаться вперед с такой-то скоростью, назад, поворачивать, ничего не делать). На основании принятого решения Среда дает Агенту некое вознограждение (например: убился об стену - на тебе -100 очков. не убился, но проехал там где уже был +1, там где не был +10, сели батарейки и ты не доехал до зарядной станции - -10000 очков и гемовер) и переходит в новое состояние. После этого Агент снова делает ход (принимает решение), получает вознаграждение и снова и снова. Задача Агента принимать Решения так чтобы максимизировать сумму Вознаграждений в течении всей сессии (либо в пределе если сессия не имеет окончания). Плюс там вводятся (или не вводятся) всякие понижающие коэффициенты чтобы показать модели что важнее небольшое вознаграждение сейчас или большое но позже.


Главное что вот это все хозяйство это просто модель описывающая подход к решению задачи, переводящий непонятные компьютеру хотелки (пропылесосил квартиру, выиграл в шахматы) в математическую логику понятную компьютеру. И вообще говоря нейросети не являются единственным способом решения данной задачи. Один из таких способов это так называемый Q-learning. В нем строится одна большая табличка в которой строки - состояния, колонки - действия, а ячейка - вознаграждение (строго говоря ожидаемое вознаграждение если в данном состоянии предпринять данное действие, а в дальнейшем все действия выполнять оптимально). Как именно строится данная табличка в данном случае не важно, но очевидно что имея данную табличку Агент может действовать довольно просто. Зная текущее состояние он находит строчку с ним, и смотрит в какой из колонок будет максимальное вознаграждение и выбирает действие из этой колонки.


Проблема данной таблички в том что ее реально построить только для более-менее игрушечных задачек. В реальности количество состояний будет огромно (если вообще конечно), да и действий будет не мало (опять же не факт что конечно), а уж ячеек там... И вот только тут у нас появляется нейросеть. Нейросеть всего навсего делает то что она делает хорошо - апроксимирует эту табличку по неполным данным. Вот тут и начинается то о чем вы говорили - отбор представителей которые лучше других апроксимируют данную табличку и все такое.


Потому на поведение именно нейронки награда строго говоря не влияет никак. Награда влияет на таблицу полезности. Именно эта таблица и будет как-бы искуственным интеллектом. Но раз построить эту таблицу мы не можем, то нейронка помогает нам сделать вид что мы ее построили, а уж что там внутри - ее волнует мало.

3
Автор поста оценил этот комментарий

Нейроосеть учится на случайных хаотичных движениях. После этого кто-то должен сказать ей, сдалала ли она "хорошо" или "плохо". Это может сделать как человек, так и система ценностей.

2
Автор поста оценил этот комментарий

А там для настройки НС специальные утилитки есть. Если что, я в этом не особо рублю, но читал статью на хабре. Сколько-то итераций обучение проходит, затем смотрят на результат и веса подстраивают в нужную сторону. Зачастую не всегда угадывают, куда именно надо, но вот этот метод вроде называется "обучение с учителем".

0
Автор поста оценил этот комментарий

Не в тз, а в имплементации. Надо было скорость назад считать как отрицательную (а не по модулю), тогда такой херни бы не случилось.

раскрыть ветку (4)
0
Автор поста оценил этот комментарий

Сомневаюсь, что запрет ездить назад (ваше предложение) решит проблему: без этого направление эффективная траектория невозможна.

раскрыть ветку (3)
2
Автор поста оценил этот комментарий

Это как раз таки не запрет, это просто отрицательная скорость. То есть если надо - пожалуйста, но лучше без нее. И гонять задом наперед точно не будет, ибо это не будет целью оптимизации скорости.

раскрыть ветку (2)
0
Автор поста оценил этот комментарий
То есть если надо - пожалуйста
Вы сказали "Надо было скорость назад считать как отрицательную", а отрицательная оценка для нейронки - это запрет, она не человек "если очень хочется, то можно". Там нужно выстраивать логику использования движения назад, чтобы это работало.
раскрыть ветку (1)
1
Автор поста оценил этот комментарий

Нет, это не так работает, если оптимизируется правильный параметр.


Оптимизировать нужно среднюю скорость. Если грубо ты ехал 1м/с и уперся в стену (скорость 0), то ты отьедешь назад (-1, кратковременно) и поедешь дальше вперед, параметр 0,8.


А если не будешь ехать назад то средняя скорость асимптотически упадет до нуля, что хуже.


Так что это не табу, а барьер от злоупотреблений.


Ну и вообще, скорость - векторная величина, очень интересно, в какой системе координат работал автор твита.

Вы смотрите срез комментариев. Чтобы написать комментарий, перейдите к общему списку

Темы

Политика

Теги

Популярные авторы

Сообщества

18+

Теги

Популярные авторы

Сообщества

Игры

Теги

Популярные авторы

Сообщества

Юмор

Теги

Популярные авторы

Сообщества

Отношения

Теги

Популярные авторы

Сообщества

Здоровье

Теги

Популярные авторы

Сообщества

Путешествия

Теги

Популярные авторы

Сообщества

Спорт

Теги

Популярные авторы

Сообщества

Хобби

Теги

Популярные авторы

Сообщества

Сервис

Теги

Популярные авторы

Сообщества

Природа

Теги

Популярные авторы

Сообщества

Бизнес

Теги

Популярные авторы

Сообщества

Транспорт

Теги

Популярные авторы

Сообщества

Общение

Теги

Популярные авторы

Сообщества

Юриспруденция

Теги

Популярные авторы

Сообщества

Наука

Теги

Популярные авторы

Сообщества

IT

Теги

Популярные авторы

Сообщества

Животные

Теги

Популярные авторы

Сообщества

Кино и сериалы

Теги

Популярные авторы

Сообщества

Экономика

Теги

Популярные авторы

Сообщества

Кулинария

Теги

Популярные авторы

Сообщества

История

Теги

Популярные авторы

Сообщества

Недвижимость и ремонт

Теги

Популярные авторы

Сообщества