Материал: Влияние подкрепления и наказания на поведение

Внимание! Если размещение файла нарушает Ваши авторские права, то обязательно сообщите нам

В классической версии игры World of Warcraft, игрок в среднем способен прокачаться с 1 до 4 уровня за несколько часов игры, а прокачка с 5 до 10 уровня может занять несколько дней игры. Достижение самых высоких уровней, занимало месяцы, или даже годы усилий. Тем более немаловажен сам способ повышения уровня персонажа.

Экспоненциальный рост игрового времени, которое требуется для того, чтобы достичь следующего уровня имеет следующее преимущество.

Он убеждает игроков, что игроку требуется больше времени, чтобы достичь больших уровней, и призывает их продлить подписку на игру

Он гарантирует игроку, что высокие уровни - редкое явление, и это является сильным подкреплением для игроков, стремящихся к статусу.

Тем не менее быстрый рост сложности условий, требуемых для получения подкрепления - (получение нового уровня) вызывает относительное напряжение. Напряжение режима включает в себя риск, что игрок в какой-то момент найдет усилия, затрачиваемые на достижение нового уровня непропорциональными самой награде, и может просто отказаться от этих усилий, и, соответственно, отказаться от игры Medler, B., John, M. and Lane, J. Data Cracker: Developing a Visual Game Analytic Tool for Analyzing Online Gameplay. In Proceedings of CHI 2011. Vancouver, BC Canada. Неудивительно, что геймдизайнеры выбирают режимы соотношения подкрепления для продвижения по уровням, потому что эти режимы имеют наименьшую восприимчивость к напряжению режима. Как мы можем увидеть, все фиксированные режимы подкрепления вызывают пост-подкрепляемые паузы - временное снижение частоты поведения после подкрепления, длительность которого зависит от величины подкрепления, и длительности временного интервала, после которого поведение будет снова подкреплено. Геймдизайнеры также часто не дают точной информации, сколько усилий потребуется для достижения следующего уровня, устанавливая продвижение по уровням на режим вариативного соотношения, Такой режим, показывает наибольшую сопротивляемость угасанию поведения, режим, который не производит никаких пост-подкрепляемых пауз, и который наиболее эффективен в производстве высокого уровня ответа в течении длительного периода времени Toma, C. L. Affirming the Self through Online Profiles: Beneficial Effects of Social Networking Sites. In Proceeding of CHI 2010, р. 1749-1752.

В дополнение к увеличению опыта, необходимого для получения следующего уровня, другие методы часто используются, чтобы сделать достижение следующего уровня более сложным. К примеру:

Игрок может получать опыт только от монстров (убийства), которые находятся близко по уровню к игроку или выше, так что игроки должны искать более сильных монстров, чтобы получить опыт, и продвинуться. Либо получать валюту\опыт только за те задания, которые предназначены примерно для его уровня (в среднем стандартное отклонение равняется 2,24).

На ранних уровнях игроки могут убить монстра близкого к ним по уровню (разброс в играх колеблется ±5 уровней), в то время как на высоких уровнях для убийства монстра может потребоваться группа игроков, поэтому на более высоких уровнях игроку придется найти группу других игроков для совместных приключений.

В то время как игра в группе обычно более веселая, часто занимает много времени найти подходящую группу, с которой можно сойтись. Им надо быть не только такого же уровня как и вы, им также необходимо играть за другие классы. К примеру, обычно желательно иметь в группах бойцов, лекарей и волшебников. Логистика поиска групп может быть сложным и длительным процессом.

При борьбе в группе вы делитесь опытом, это означает что вы получаете меньше опыта за убийство монстра. Чем больше игроков в группе, тем меньше опыта вы получите, однако тем проще будет убить этого монстра.

.5 Параллельные режимы подкрепления

В жизни нам часто представляются множественные режимы подкрепления, и наши действия в любой момент - результат выбора между альтернативами. Психологи пытались понять, как организмы выбирают между множествами типами режима подкрепления, и отметили поразительную согласованность наших выборов. Они обнаружили, что организмы выбирают режим подкрепления в точной пропорции по отношению к частоте, величие, или задержке подкрепления для каждого из режимов. К примеру, если голубь получает одну порцию еды за то, что ударит по синему ключу пять раз, но две порции еды за 5 ударов по красному, голуби будут бить красную кнопку в два раза чаще чем синюю. Точно также, если режим предусматривает подкрепление в два раза чаще другого, организмы выбирают этот режим над другим в соотношении 2:1. Эта связь известна под названием "закон соответствия", который гласит, что относительная скорость реакции на альтернативный выбор приблизительно равна отношению к частоте, величие и незамедлительности подкрепления получаемого за выбор этой альтернативы Miltenberger, R. G. "Behavioral Modification: Principles and Procedures". Thomson/Wadsworth, 2008. p. 86 .

Исследования пищевого поведения животных в их естественной среде дали результаты, согласующиеся с этим законом. Позже была разработана теория оптимального фуражирования, в 1966 году Р. Макартуром. Теория оптимального фуражирования гласит, что пищевое поведение зависит от соотношения между количеством энергии, затрачиваемом при поиске, получении и употреблении пищи, и количеством энергии которое обеспечивает питание. Чистая прибыль энергии определяет размер, качество, дефицит, и работу, затраченную на завладение добычей. Когда дается выбор между едой, животные выберут в точной пропорции к чистой прибыли энергии из различных вариантов питания (т.е. применяет этот закон). Постулат теории звучит так - животное стремится максимально увеличить скорость потребление энергии, которую оно получает из добычи. Поведение фуражирования животных, как например пчел, сов, и грызунов были рассчитаны с высокой точностью благодаря теории оптимального фуражирования, и её формуле  , где  - скорость потребления пищи,  - количество энергии данного вида добычи, t1 - время поиска добычи, t2 - время обработки добычи.

.6 Практические вопросы реализации системы вознаграждения в онлайн-игре

При анализе дизайна онлайн-игры со стороны оперантного научения (обуславливания), необходимо определить

Какой режим подкрепления применяется?

Какие награды (будут) использованы в игре?

Какое поведение подкрепляется?

В некоторых играх этот процесс прост. К примеру, очевидно, что онлайн-покер следует режиму переменного подкрепления. В других играх разгадать режим подкрепления гораздо сложнее. К примеру разные игроки могут находить различные части одной игры подкрепляющими. Например некоторые игроки в онлайн-тетрис могут находить подкрепляющим: ставить блоки идеально, другие - заполнять ряды. При этом оба игрока пользуются разным вариативным режимом подкрепления.

Вопрос о внедрении систем вознаграждения осложняет факт научения вторичным подкреплениям. Игрок, которому нравится заполнять ряды, наверняка научится наслаждаться от идеальной постановки блоков, и теперь будет оперировать двумя режимами подкрепления. Немного подкреплений выучивается, но главенствующие мотивы игры из-за них могут измениться. К примеру новые игроки могут быть мотивированы шансом исследовать игру и протестировать возможности, ею предлагаемые. Когда они исчерпывают свое первоначальное любопытство, они могут перейти к попыткам заработка очков, еще позже, они могут приступить к попыткам получить больше очков чем другие игроки.

Следующее осложнение состоит в том, что может измениться не только система наград, но и тип режима подкрепления используемый по ходу игры. К примеру, награда может изначально быть предусмотрена с фиксированным соотношением, но по ходу игры режим может измениться на переменный тип. Анализ дизайна игровых наград требуется с обеих сторон - новичка и опытного игрока.

Для примера рассмотрим онлайн-тетрис - это простая игра, но она использует множество типов подкрепления. Все они оперируют на вариативном режиме.

Позитивное подкрепление - получение очков и заполнение рядов, высокий счет очков и его улучшение, заполнение пространства блоками, выигрыш или переход на след уровень.

Негативное подкрепление - избегание проигрыша, построение столбцов из блоков, неудача в увеличении рекорда очков.

.8 Позитивные и негативные стимулы как факторы воздействия на поведение

Существует два основных вида подкрепления и наказания. В предыдущей части работы мы говорили только о положительных стимулах. Существуют также негативные подкрепления и наказания. Стимул считается негативным, если после определённого поведения происходит удаление аверсивного стимула (подкрепление), или удаление подкрепляющего стимула (наказание). Наглядная классификация представлена в табл.№99

Таблица


Позитивное

Негативное

Подкрепление

Получение награды

Удаление аверсивного стимула

Наказание

Потеря награды

Удаление подкрепляющего стимула


Тем не менее, современная наука обладая определением данного вида стимула, несмотря на активное употребление его в научной литературе не смогла установить однозначную зависимость и связь между позитивными и негативными факторами подкрепления. Негативное подкрепление активно используется в нашей повседневной жизни. Например:

Неприятный звук при не пристёгнутом пассажире в автомобиле является негативным стимулом, а наградой считается исчезновение этого звука, если пассажир пристегнётся (Gredler, 1992).

Приём таблетки аспирина при головной боли. Головная боль как негативный стимул, который удаляется при приёме аспирина Buskist & Gerbing, 1990; Gerow, 1992.

Подкрепление и наказание являются природным арсеналом в управлении подведением. Хорошо известно, что подкрепляющие и нет стимулы оказывают критически сильное влияние на поведение. Как уже говорилось выше, с начала прошлого века психология сделала неизмеримо большой шаг в изучении поведения человека и животных. Были разработаны тысячи теорий, проведены десятки тысяч экспериментов и многое другое. Затраченные усилия не прошли даром, полученные данные были использованы в множестве ситуаций, в том числе на первый взгляд не относящиеся к психологии. Примером того может служить проектировка вокзалов, где особое расположение "препятствий" рассеивает толпу, улучшает инфраструктуру и т.п. Несмотря на то, что фундаментальные законы подкрепления были сформулированы относительно давно, и претерпели за время своего существования мало изменений, существует насущная потребность в постоянном совершенствовании теоретического аппарата, не в последнюю очередь благодаря специфике нашего постоянно развивающегося и изменяющегося мира. До настоящего времени неизвестно об однозначном различии подкрепления и наказания и их влияния на поведение. С одной стороны, приверженцы однофакторной теории предполагали (как и сам Торндайк), согласно закону эффекта, что подкрепление и наказание, грубо говоря, являются стимулами, симметрично расположенными на отрезке [-1;1], где положительный стимул является подкреплением, а отрицательный - наказанием. Иначе говоря - подкрепление увеличивает частоту поведения, наказание её снижает, и величины этих эффектов равны Miltenberger, R. G. "Behavioral Modification: Principles and Procedures". Thomson/Wadsworth, 2008. p. 86 . С другой стороны, к этому утверждению стоит относиться лишь как к допущению, ибо оно не подкреплено достаточными эмпирическими данными. Виной тому - недостаточно совершенная экспериментальная среда, и нехватка креативных методов по оценке влияния подкрепления и наказания. В прошлом веке из-за недостаточно развитого технического оснащения, и невозможности стандартизации в одной шкале измерения положительного и отрицательного подкрепления оставалось только избегать данных вопросов. Оставался неразрешённым вопрос: "Оказывают ли эти факторы симметричное, или качественно различное влияние на поведенческие реакции". В противоположность однофакторной теории, приверженцы двухфакторных теорий смотрят на подкрепление и наказание как качественно различные факторы, влияющие на поведение.

Немногие источники базовой литературы по вопросам науки о поведении поддержали больший уклон в прикладное применение полученных знаний, чем исследовании и совершенствовании теории о аверсивном контроле (наказание и негативное подкрепление) поведения. Вероятно, наиболее наглядно это продемонстрировал Skinner (1953, 1971, 1974) Skinner, B.F. (1953). Science and human behavior. New York: Macmillan. doi: Skinner, B.F. (1971). Beyond freedom and dignity. New York: Knopf.Skinner, B.F. (1974). About behaviorism. New York: Knopf. и Сидман idman, M. (1989). Coercion and its fallout. Boston: Authors Cooperative. Они экстраполировали эту работу, чтобы выдвинуть обширное заключение о предполагаемых опасностях аверсивного контроля поведения в повседневной жизни, что повлекло за собой уточнение учебников по прикладному бихевиоризму.( Cooper, J.O., Heron, T.E., & Heward, W.L. (2007). Applied behavior analysis (2nd ed.). Upper Saddle River, NJ: Pearson.)и другие трактаты о роли контроля за поведением в повседневной жизни. Baum, W.M. (2005). Understanding behaviorism: Behavior, culture, and evolution (2nd Ed.). Malden, MA: Blackwell. Daniels, A. (1984). Bringing out the best in people: How to apply the astonishing power of positive reinforcement. New York: McGraw Hill.1чтобы повторить их заключения с дополнением результатов прикладного бихевиоризма. Однако, вплоть до этого момента, фундамент отрасли поведенческой психологии - о аверсивном контроле поведения, на которой основаны практические советы, ещё далек от однозначного и устоявшегося построения. Действительно, на протяжении многих десятилей наука о поведении погрязла в классических рассуждениях об аверсивном контроле поведения, которые мало свидетельствуют о окончательном разрешении этой проблемы . Baron, A. (1991). Avoidance and punishment. In I.H. Iverson & K.A. Lattal (Eds.), Experimental analysis of behavior, Part 1 (pp. 173-217). Amsterdam: Elsevier.Baron, A., & Galizio, M. (2005). Positive and negative reinforcement: Should the distinction be preserved? The Behavior Analyst, 28, 85-98.Critchfield, T.S., Paletz, E., MacAleese, K., & Newland, M.C. (2003). Punishment in human choice: Direct or competitive suppression? Journal of the Experimental Analysis of Behavior, 80, 1-27.

Таким образом, стандартные рекомендации по контролю поведения с упоминанием аверсивного контроля могут представлять собой случаи натягивания практики на теорию. В связи с этим возникает насущная потребность вернуться к наиболее фундаментальным вопросам об управлении аверсивными стимулами для прогресса в поведенческой психологии. Critchfield, T.S., & Farmer-Dougan, V.F. (2014). Isolation from the mainstream: Recipe for an impoverished science. European Journal of Behavior Analysis, 15, 6-13. Что касается негативного подкрепления, центральный вопрос до сих пор остающийся без ответа касается того, как оно отличается от положительного подкрепления, в частности, являются ли эти подкрепления различными на фундаментальном уровне, или же позитивное и негативное подкрепление остаются "двумя сторонами одной монеты" Mowrer, O.H. (1947). On the dual nature of learning-a re-interpretation of “conditioning” and “problem solving.” Harvard Educational Review, 17, 102-148.. Периодические обновления и расширения этих двух концепций не привели ни к консенсусу враждующие стороны Baron, A., & Galizio, M. (2005). Positive and negative reinforcement: Should the distinction be preserved? The Behavior Analyst, 28, 85-98... Dinsmoor, J.A. (2001). Stimuli inevitably generated by behavior that avoids electric shock are inherently reinforcing. Journal of the Experimental Analysis of Behavior, 75, 311-333., ни к какому либо коллективному исследованию этих факторов, которые обычно необходимы для разработки и продвижения научной теории Critchfield, T.S., & Rasmussen, E.B. (2007). It's aversive to have an incomplete science of behavior. Mexican Journal of Behavior Analysis, 33, 1-6..

Источник: https://www.bibliofond.ru/view.aspx?id=898217