Если бы бампер был еще и сзади, подозреваю, что оноб или на месте стояло или бы по кругу наварачивало.
Если бы бампер был сзади и было бы поощрение за проход территории, то, думаю, вы правы: потыкался бы немного по стенам и начал бы наворачивать круги. ИИ - хайпожор :)
Можно. Думаю, будет хуярить в рэндомную сторону тупо по прямой. Веса правильно распределить надо. Вводная про столкновения не очень понятна, взаимоисключающие параметры.
Решение выглядит как-то так. Я не программирую нейронки, но могу накидать вариант.
Есть 100% территории
Задача:
1)пройти 100% территории, при этом:
1. не въебавшись
2. не используя задний ход
3. не проходя по одному и тому же маршруту больше 3 раз(тут нужны тесты, ибо зависит от местности)
2) после успешного выполнения закрепить модель поведения и использовать её всегда
3) Опционально. Оптимизировать маршрут в как можно более сжатый по времени
????
Профит.
Из узких мест - разворот и вперёд, про стены почему нет? Пару (десятков) раз уебётся, дальше перестанет, это же самообучающаяся нейронка, ей критерии недопустимости и необходимости только нужны, это всё берётся из техзадания, а там уже она найдёт выход
Из узких мест - разворот и вперёд
Ну, это только если татарский пылесос, который разворачивается и алга! ))
Ну у меня такой пылесос:)) Вертится по чуть-чутьпо часовой и тыкается вперед, пока выход не найдёт. Это значит, он косячный?
Как ни вспомнить "Исполнителя желаний" 1997 года?Я хочу, чтобы ты катился отсюда на все четыре стороны.
Слушай, объясни, как "награда" влияет на поведение нейронки. Все обучения, что я видел, проводились с рандомизацией параметров в определенных пределах и отбором лучших представителей из выборки, которых мутировали дальше. Просто как допустим указать, что если происходит событие х, то нужно поднять вес нейрона у на z процентов?
Немного спутано теплое с мягким.
"Награда" это из терминологии "Обучения с подкреплением (Reinforced learning)". Тип задач машинного обучения такой. Задача сводится к модели в которой есть Агент (в данном случае пылесос) и есть Среда (квартира). Агент получает от Среды информацию о состоянии (совокупность показания датчиков пылесоса) и принимает одно из возможных Решений (двигаться вперед с такой-то скоростью, назад, поворачивать, ничего не делать). На основании принятого решения Среда дает Агенту некое вознограждение (например: убился об стену - на тебе -100 очков. не убился, но проехал там где уже был +1, там где не был +10, сели батарейки и ты не доехал до зарядной станции - -10000 очков и гемовер) и переходит в новое состояние. После этого Агент снова делает ход (принимает решение), получает вознаграждение и снова и снова. Задача Агента принимать Решения так чтобы максимизировать сумму Вознаграждений в течении всей сессии (либо в пределе если сессия не имеет окончания). Плюс там вводятся (или не вводятся) всякие понижающие коэффициенты чтобы показать модели что важнее небольшое вознаграждение сейчас или большое но позже.
Главное что вот это все хозяйство это просто модель описывающая подход к решению задачи, переводящий непонятные компьютеру хотелки (пропылесосил квартиру, выиграл в шахматы) в математическую логику понятную компьютеру. И вообще говоря нейросети не являются единственным способом решения данной задачи. Один из таких способов это так называемый Q-learning. В нем строится одна большая табличка в которой строки - состояния, колонки - действия, а ячейка - вознаграждение (строго говоря ожидаемое вознаграждение если в данном состоянии предпринять данное действие, а в дальнейшем все действия выполнять оптимально). Как именно строится данная табличка в данном случае не важно, но очевидно что имея данную табличку Агент может действовать довольно просто. Зная текущее состояние он находит строчку с ним, и смотрит в какой из колонок будет максимальное вознаграждение и выбирает действие из этой колонки.
Проблема данной таблички в том что ее реально построить только для более-менее игрушечных задачек. В реальности количество состояний будет огромно (если вообще конечно), да и действий будет не мало (опять же не факт что конечно), а уж ячеек там... И вот только тут у нас появляется нейросеть. Нейросеть всего навсего делает то что она делает хорошо - апроксимирует эту табличку по неполным данным. Вот тут и начинается то о чем вы говорили - отбор представителей которые лучше других апроксимируют данную табличку и все такое.
Потому на поведение именно нейронки награда строго говоря не влияет никак. Награда влияет на таблицу полезности. Именно эта таблица и будет как-бы искуственным интеллектом. Но раз построить эту таблицу мы не можем, то нейронка помогает нам сделать вид что мы ее построили, а уж что там внутри - ее волнует мало.
Нейроосеть учится на случайных хаотичных движениях. После этого кто-то должен сказать ей, сдалала ли она "хорошо" или "плохо". Это может сделать как человек, так и система ценностей.
А там для настройки НС специальные утилитки есть. Если что, я в этом не особо рублю, но читал статью на хабре. Сколько-то итераций обучение проходит, затем смотрят на результат и веса подстраивают в нужную сторону. Зачастую не всегда угадывают, куда именно надо, но вот этот метод вроде называется "обучение с учителем".
Не в тз, а в имплементации. Надо было скорость назад считать как отрицательную (а не по модулю), тогда такой херни бы не случилось.
Сомневаюсь, что запрет ездить назад (ваше предложение) решит проблему: без этого направление эффективная траектория невозможна.
Это как раз таки не запрет, это просто отрицательная скорость. То есть если надо - пожалуйста, но лучше без нее. И гонять задом наперед точно не будет, ибо это не будет целью оптимизации скорости.
То есть если надо - пожалуйстаВы сказали "Надо было скорость назад считать как отрицательную", а отрицательная оценка для нейронки - это запрет, она не человек "если очень хочется, то можно". Там нужно выстраивать логику использования движения назад, чтобы это работало.
Нет, это не так работает, если оптимизируется правильный параметр.
Оптимизировать нужно среднюю скорость. Если грубо ты ехал 1м/с и уперся в стену (скорость 0), то ты отьедешь назад (-1, кратковременно) и поедешь дальше вперед, параметр 0,8.
А если не будешь ехать назад то средняя скорость асимптотически упадет до нуля, что хуже.
Так что это не табу, а барьер от злоупотреблений.
Ну и вообще, скорость - векторная величина, очень интересно, в какой системе координат работал автор твита.


Гильдия Воров Пикабу
1.3K постов2.7K подписчиков
Правила сообщества
Правил нет. Воруйте и еб#те гусей.
Соблюдайте правила пикабу