Текст книги "Психология развития: методы исследования"
Автор книги: Скотт Миллер
Жанр:
Психология
сообщить о нарушении
Текущая страница: 20 (всего у книги 48 страниц) [доступный отрывок для чтения: 20 страниц]
Альтернативы и более сложные варианты дисперсионного анализа
В этом разделе мы вернемся к вопросу сравнения групп. Не будет преувеличением сказать, что, по крайней мере последние 50 лет, дисперсионный анализ является самым распространенным методом такого сравнения. Однако, несмотря на свою популярность, ДА – не всегда предпочтительный вариант статистического анализа, даже в случаях, когда предположения, лежащие в его основе, справедливы. Есть ситуации, в которых более полное представление о полученных результатах дают другие формы анализа. В этом разделе мы кратко рассмотрим ряд таких ситуаций и соответствующие статистические процедуры. Еще менее чем в предыдущих разделах изложение претендует на полноту; цель заключается лишь в том, чтобы дать читателю возможность понять или переосмыслить разнообразные варианты более глубокого анализа и основания для его использования.
Плановые сравнения
Ранее мы отметили проблемы, возникающие при множественности значений t-критерия, следствием которых является необходимость использования дисперсионного анализа, позволяющего осуществить обобщенную проверку на наличие или отсутствие значимых-эффектов. Однако обобщенные проверки не всегда облада-
ют преимуществом. ДА более всего подходит для тех случаев, когда у исследователя нет четких гипотез и ему скорее хочется выявить любые интересные результаты, которые может дать исследование. В подобных случаях такая комплексная проверка, как ДА, предпочтительнее множества одиночных проверок. Однако в некоторых исследованиях имеются четкие гипотезы, и основная цель проведения статистической проверки состоит в получении ясного ответа в отношении каждой из гипотез. В таких случаях ДА малоэффективен, поскольку эта форма анализа включает сравнения, которые могут и не интересовать исследователя, тем самым снижая эффективность сравнения того, что действительно интересно.
Рассмотрим пример (взятый из работы Hays, 1981). Нас интересует влияние обучения детей на их ответы при использовании нравственных дилемм Колберга (см. главу 12). Мы используем две формы обучения детей: наблюдение за взрослым, дающим ответы, которые соответствуют более высокому нравственному уровню, и обсуждение вопросов нравственности в группе сверстников. Нам также интересен возможный эффект сочетания двух типов обучения, поэтому мы включаем третье экспериментальное условие, при котором дети и наблюдают за отвечающим взрослым, и проводят обсуждение в группе. Мы знаем, что для оценки эффекта обучения необходима контрольная группа; поэтому четвертое условие состоит исключительно в претесте и посттесте, без каких-либо экспериментальных вмешательств. Однако нас беспокоит, что наблюдение образца поведения или внутри-групповое взаимодействие могут сами по себе повлиять на ответы, вне зависимости от нравственного развития, которое мы изучаем. Поэтому мы включаем еще два контрольных условия; одно – при котором дети наблюдают взрослого, рассуждающего о чем угодно, кроме нравственных проблем; и второе – при котором дети обсуждают любую тему, не касающуюся нравственности.
В таком исследовании нас в действительности не интересует главный эффект каждого из условий, эффект, который может быть обусловлен значимой разницей ■ между любыми из возможных пар средних значений. Наш интерес более специфичен и ограничен сравнениями между средними значениями, которые важны для исследования. Мы, к примеру, захотим выяснить, отличается ли на уровне значимости каждое из экспериментальных условий от соответствующего ему контрольного, а также, различаются ли между собой три экспериментальных условия. Эти сравнения действительно имеют смысл. В других сравнениях гораздо меньше смысла – к примеру, бессмысленно сравнивать экспериментальное условие группового обсуждения и контрольное условие наблюдения поведения взрослого. Обобщенный дисперсионный анализ объединяет все эти сравнения. Конечно, можно начать с проверки f-критерия, а затем использовать отдельные дополнительные критерии для интересующих нас сравнений-. Однако существует риск, что главный эффект F не будет обладать значимостью, и в этом случае у нас не будет реальных оснований для дополнительных проверок. Кроме того, критерии, используемые после получения значимого результата при дисперсионном анализе, обладают меньшей мощностью, что означает риск упустить из вида действительно важный эффект.
Альтернативой ДА в таких случаях служат плановые сравнения, когда мы заранее определяем, какие из средних значений будем сравнивать, и производим толь-
ко эти сравнения. В нашем гипотетическом исследовании обучения, к примеру, мы могли бы провести сравнение экспериментальных воздействий,, оставив без внимания другие сравнения. Разъяснение методов проведения такого избирательного сравнения не входит в намерения автора; описание их можно найти в большинстве учебников по статистике (например, Hays, 1981). Разумеется, такой подход влечет потерю некоторой информации. Однако если мы точно знаем, что нас интересует, потеря будет минимальной. А поскольку критерии, используемые в предварительно спланированных проверках, обладают большей мощностью, чем критерии post-hoc, наши шансы получить ясные вопросы на интересующие нас вопросы выше.
Важно подчеркнуть, что плановые сравнения действительно подразумевают планирование и избирательность; то-есть мы не можем сравнивать что.угодно. Каким должно быть количество сравниваемых пар – на этот счет специалисты в области статистики не имеют единого мнения. Одни из них рекомендуют ограничивать плановые сравнения статистически независимыми, или «ортогональными», парами. Количество таких независимых пар на одну меньше количества средних значений; в нашем исследовании обучения оно будет составлять 5 независимых сопоставлений (в упоминавшейся выше работе объясняется, как определить независимость сопоставлений (Hays, 1981)). Другие специалисты являются приверженцами несколько более либерального подхода, говоря о том, что интересные с теоретической точки зрения пары можно проверить даже при отсутствии полной их независимости. В работе Кеппел (Keppel, 1991) можно найти полезную информацию о разных точках зрения, а также ряд методов корректировки уровня вероятности в случаях, когда производятся множественные или частично пересекающиеся сравнения.
Величина эффекта
Цель плановых сравнений состоит в выявлении эффектов, которые могут упустить такие глобальные проверочные процедуры, как ДА. Процедура измерения величины эффекта снимает некоторые из ограничений ДА. В этом случае мы предполагаем, что при анализе был обнаружен значимый эффект; тогда встает вопрос, насколько он велик. Насколько сильна связь между зависимыми и независимыми переменными?
Чтобы разобраться в этом вопросе, нужно вспомнить то, о чем мы говорили ранее, обсуждая термин «статистическая значимость». Установление факта статистической значимости свидетельствуете наличии и некой неслучайной связи между переменными. Факт наличия значимости ничего не говорит о силе этой связи. О масштабах эффекта можно, конечно, догадываться по средним значениям; большая разница между средними, очевидно, отражает более значимый эффект, чем Меньшая разница. Но есть ли более точная мера величины эффекта? j
Ответ состоит в том, что сегодня для расчета величины эффекта существует ряд методов. Основные работы, в которых дается описание этих методов, следующие: Коэн (Cohen, 1977), Розенталь (Rosenthal, 1994b) и Тацоука (Tatsouka, 1993). Здесь я опишу простейшую из процедур, разработанную Коэном (Cohen, 1977). Согласно этому подходу, величина эффекта, или d, определяется как разница между двумя средними, разделенная на стандартное отклонение в сравниваемых группах.
Таким образом, учитывается средняя разница, которая оценивается с точки зрения изменчивости показателей. Чем меньше изменчивость, тем существеннее средняя
разница.
Сейтц (Seitz, 1984) приводит пример. Стандартное отклонение в большинстве тестов IQ равно 15. Средняя разница между группами, равная 12, (каковой она, к примеру, указывается в исследовательских отчетах для только что поступивших в колледж и докторов философии) означала бы величину эффекта 0,8, если бы средняя разница составляла 7 пунктов, величина эффекта была бы равной 0,2. Для интерпретации этих величин можно графически изобразить распределение показателей двух популяций и область их пересечения. На рис. 7.5 изображены кривые, соответствующие трем описанным выше ситуациям, Заметьте, что с возрастанием величины эффекта сокращается область совпадения. Как отмечает Сейтц средняя пара кривых особенно информативна. Средняя разница 7 пунктов – или, если рассматривать ситуацию в общем виде, разница, составляющая половину стандартного отклонения, – может показаться не слишком большой. Однако эта разница означает, что 70% одной популяции имеет показатели выше среднего другой популяции.
Меры величины эффекта дают полезную информацию, которую нельзя извлечь непосредственно из значений логических критериев. Однако до сих пор в исследовательских отчетах в области психологии развития – а в действительности и в психологии в целом – редко можно встретить указания на величину эффекта (Cohen, 1994). При обзоре любого журнала по психологии развития можно обнаружить не один десяток F и t, но лишь несколько скромных попыток рассчитать формальные показатели величины разнообразных эффектов.
Мультивариантный дисперсионный анализ
Разница между одновариантными и мультивариантными статистическими процедурами довольно расплывчата; разные специалисты определяют ее по-разному. Однако наиболее распространенным критерием служит количество зависимых переменных. Если анализ проводится при наличии одной зависимой переменной, его можно назвать одновариаптным. Процедура использования r-критерия и дисперсионный анализ – одновариантные статистические процедуры. Если в анализе задействуется более одной зависимой переменной, его можно назвать мульти-вариантным. Существует ряд мультивариантных статистических процедур, к которым относится и мультивариантный дисперсионный анализ, или МДА.
Использование мультивариантных статистических процедур – явление, получившее широкое распространение в психологических исследован иях совсем недавно. Как отмечает Сейтц (Seitz, 1980), статистические основы для этих процедур были выработаны уже давно; проблемы начинались при их практическом использовании. Расчеты мультивариантных статистических показателей зачастую чрезмерно сложны и громоздки, и поэтому до появления компьютеров и соответствующих компьютерных программ использование мультивариантных статистических процедур было крайне затруднено. Наличие компьютера и навыки работы на нем могут оказаться весьма ценными для проведения любой формы статистического анализа.

Рис. 7.5. Разница между популяциями, соответствующая разным значениям величины эффе
Расчеты – не единственная сложность, связанная с мультивариантными статистическими процедурами. В определенном смысле, расчеты – самое простое, поскольку эту работу выполняет компьютер. Настоящая проблема – определить, когда необходим мультивариантный анализ и как интерпретировать его результаты. Для ответа на эти вопросы написано множество книг и прочитано множество теоретических курсов, в том числе весьма подробных и содержательных (см., например: Hair, Anderson, Tatham & Black, 1992; Morrison, 1990; Nesselroade & Cattell, 1988). Здесь я затрону лишь несколько моментов, о которых ведется речь в более сжатой работе (Applebaum & McCall, 1983), ориентированной на специалистов в области психологии развития.
Предположим, проведено исследование с двумя или более зависимыми переменными. Как узнать, нужно ли проводить отдельный ДА для каждой из переменных (этот вариант всегда необходимо учитывать) или объединить их все в МДА? Эпплбаум и Маккол говорят о двух основных преимуществах МДА перед ДА. Одно из них сходно с преимуществом F-крнтерия перед отдельными f-критерия-ми. Чем больше проверок с помощью дисперсионного анализа мы проводим, тем выше вероятность, что некоторые эффекты достигнут уровня статистической зна-
чимости чисто случайно. При проведении МДА уровень вероятности при любых сравнениях, напротив, сохраняется постоянным. Второе преимущество имеет отношение к возможности при проведении МДА использовать информацию о связи между зависимыми переменными, информацию, которая не учитывается при ДА, когда анализ каждой переменной производится отдельно. Одновременный учет всех переменных, среди прочего, означает, что при помощи МДА иногда можно выявить значимые эффекты, которые упускает ДА.
Как следует из вышесказанного, МДА уместно использовать только тогда, когда есть основания предположить, что между зависимыми переменными существует некая интересная связь. Как пишут Эпплбаум и Маккол (Applebaum & McCall, 1983): «Вы не включаете в МДА все имеющиеся переменные, лишь бы увидеть, что из этого получится. Зависимые переменные нужно осмысленно подбирать. Они должны образовывать логическую совокупность, которую можно интерпретировать именно как совокупность* (р. 435). Затем Эпплбаум и Маккол приводят в качестве примера исследование габитуации у младенцев, в котором зависимые переменные представляют собой следующее: длительность фиксации в первой пробе, пробу с наиболее длительной фиксацией, количество проб от самой длительной к самой непродолжительной фиксации и средняя длительность фиксации в одной пробе. Эти переменные образуют совокупность связанных между собой (но не дублирующих друг друга) показателей габитуации у младенца, для анализа которой больше подходит МДА, а не ДА. В целом, для использования МДА больше всего подходит ситуация, когда исследование включает ряд несколько различающихся между собой характеристик одного и того же конструкта (как в примере с габитуацией).
Как бы ни было кратко это изложение метода МДА, из него можно вынести главную мысль. Наличие мощной статистической процедуры – и компьютерной технологии для ее осуществления – не означает, что эту процедуру можно бездумно использовать для любого типа данных. Сутью грамотной статистической работы является знание того, какой статистический прием применим к разного рода данным и планирование исследования с целью достижения оптимального соответствия статистических процедур и данных.
Множественный регрессионный анализ
Как и МДА, множественный регрессионный анализ – сложная статистическая процедура – сложная как для проведения, так и для описания. Как и в случае с МДА, на двух-трех страницах излагать суть процедуры множественного регрессионного анализа бессмысленно. Однако регрессионный анализ стал использоваться столь широко, что краткое рассмотрение его принципов представляется оправданным.
Говоря словами Керлингер (Kerlinger, 1986), множественный регрессионный анализ – «это метод изучения результатов влияния и силы влияния более чем одной независимой переменной на одну зависимую переменную с использованием принципов корреляционного и регрессионного анализа» (р. 527). Если выразиться несколько иначе, множественный регрессионный анализ дает нам информацию о том, как связаны две или более независимые переменные, или «предикторы», с одной зависимой переменной, или «критерием». Мы, к примеру, можем провести исследование, в котором будем изучать успешность выполнения, в лабораторных условиях некоего задания как функцию от IQ, социально-экономического статуса, характера инструкций к заданию и времени, отведенного на его выполнение. Применение множественного регрессионного анализа к нашим данным позволит оценить вклад каждого из этих четырех предикторов (как но отдельности, так и в сочетании) в дисперсию критериальной переменной.
Между регрессионным и корреляционным анализом, описанным ранее в этой главе, существует тесная связь. В обоих случаях мы используем значение одной переменной у некоего испытуемого для предсказания значения другой переменной. Как следует из факта включения таких параметров, как IQ и социально-экономический статус, еще одно сходство состоит в возможности использования в регрессионном анализе переменных, которые, с точки зрения исследовательского плана, являются корреляционными, в том смысле, что они просто измеряются, а не подвергаются экспериментальным манипуляциям.
Много общего у регрессионного анализа и с дисперсионным анализом. Эти процедуры имеют одни и те же цели: определить влияние, совокупности независимых переменных на некую зависимую переменную, как по отдельности, так И во взаимодействии. Регрессионный анализ в предыдущем примере можно было бы заменить дисперсионным анализом четырех переменных, результатом которого было бы значение четырех F, указывающих на главный эффект, а также ряд значений F для взаимодействий. В действительности это правило носит общий характер: большинство задач, которые решает множественный регрессионный анализ, можно решить с помощью дисперсионного анализа. Однако, как отмечают многие авторы, из двух процедур множественный регрессионный анализ обладает более широкими возможностями, поскольку ДА – это лишь частный случай регрессионного анализа. Поэтому любую задачу, которую может решить многофакторный ДА, может решить и множественный регрессионный анализ. -
Если учесть широкие возможности множественного регрессионного анализа, можно задаться вопросом, какие факторы могут заставить нас предпочесть его ДА при анализе некой совокупности данных? Отмечу вначале, что зачастую это дело вкуса, поскольку во многих случаях оба подхода равно эффективны и информативны. Однако в некоторых отношениях множественный регрессионный анализ обладает преимуществом. Здесь я приведу два аргумента в пользу его использования.
1. Множественный регрессионный анализ особенно удобен в тех случаях, когда независимая переменная является непрерывной величиной, то есть включает широкое множество значений, а не просто несколько дискретных уровней. Пример непрерывной переменной – IQ. Включив в наше исследование IQ, мы получили бы разброс значений около 60-70 пунктов. При использовании ДА учесть всю эту дисперсию невозможно; самое большее, что мы могли бы сделать, это произвести приблизительную классификацию на «высокий», «средний» и «Низкий» интеллект. При использовании же множественного регрессионного анализа нет потери информации, поскольку переменные рассматриваются на континууме и анализируются все фактические показатели.
2. Множественный регрессионный анализ особенно подходит для изучения вопроса, о котором уже говорилось вэтом разделе: определения силы влияния независимой переменной на зависимую. Основным статистическим показателем во множественном регрессионном анализе является R2: доля дисперсии зависимой переменной, объясняемая совокупностью изучаемых независимых переменных. То есть R2 указывает на то, как «действуют» наши предикторы – насколько точно мы можем предсказать изменчивость критерия при помощи выбранной совокупности независимых переменных. Хотя сделать это и нелегко, при помощи регрессионного анализа все же можно оценить вклад каждого из предикторов в дисперсию критерия, как количественное выражение этого вклада, так и тип связи предиктора с критерием.
Среди учебников, посвященных множественному регрессионному анализу, можно назвать такие работы, как Cohen & Cohen, 1983; Draper & Smith, 1981; Pedhazur, 1982. В книге Керлингера (Kcrlinger, 1986), на которую мы уже ссылались, можно найти весьма доступное введение в данную проблематику; кроме того, это вел иколенная работа по методологии, с которой стоит ознакомиться любому, кого интересует тема психологического исследования.
Общие принципы
Завершим эту главу некоторыми общими рекомендациями, касающимися статистической части исследования.
Первая рекомендация уже была дана в главе 1: все необходимо планировать. Из всего сказанного в этой главе должно быть ясно, что есть такие аспекты анализа данных, которые нельзя полностью предусмотреть. Исследователь, к примеру, может не знать, каким будет распределение данных, пока не осуществит их сбор. Могут также появляться неожиданные, но интересные результаты, требующие статистической проверки, которую нельзя предусмотреть с самого начала. Однако настолько, насколько это возможно, количество таких статистических операций по уже свершившемуся факту следует свести к минимуму. С самого начала исследователь должен знать основные вопросы, которые будут анализироваться, и конкретные статистические критерии, которые будут использованы при анализе. Планирование помогает избежать несвоевременного разбора данных, с проведением множества проверок в поисках того, что могло бы оказаться значимым. Кроме того, планирование позволяет удостовериться в том, что для анализируемых данных и вопросов есть подходящие статистические процедуры, и выбрать наиболее мощные [1 информативные критерии.
Вторая рекомендация – будьте аккуратны. Выводы, которые можно сделать на основе результатов исследования, полностью зависят от точности статистических расчетов. Ошибка при вычислении может привести к ошибке в выводах, иногда принципиальной. Кроме того, вычислительные ошибки обнаружить труднее, чем другие; в исследовательском отчете можно обнаружить методологические просчеты, но результаты математических действий читатель, как правило, принимает на веру. Поэтому крайне важно, чтобы каждая операция проходила тщательную проверку. В идеальном случае, все расчеты должны произвести, по меньшей мере, два независимых специалиста. Полезно также сравнить результаты двух или более методов подсчета (например, на калькуляторе и на компьютере).
От исследователя требуется не просто обычная аккуратность; иногда возникают ситуации, когда статистические результаты столь необычны, что их нельзя не перепроверить. В частности, подозрения должны вызывать любые случаи несоответствия дескриптивных показателей и логических выводов о значимости. Дескриптивные и логические показатели основаны на одних и тех же данных, и поэтому они всегда должны определенным образом согласовываться. Установление статистической значимости ничтожной разницы или отсутствие значимости довольно существенной разницы должно быть стимулом к перепроверке расчетов.
Есть и еще одно замечание, которое можно сделать о проверке. Исследователь должен избегать дифференцированных проверок, когда результаты, противоречащие ожиданиям, анализируются со всей тщательностью, а результаты, подтверждающие ожидания, не проверяются. Как бы ни было естественным такое поведение, оно позволяет вкрасться эффектам необъективности экспериментатора: результатом исправления только негативных ошибок может быть псевдодоказательство гипотез исследователя. Разумеется, лучше всего проверять и корректировать все.
Последняя рекомендация – обращайтесь за советом. Сегодня доступно столько источников – учебники, компьютерные программы, специалисты в области статистики, – что новичку нужно быть совершено безрассудным человеком, чтобы в одиночку пуститься в плавание по коварным водам статистики. К эксперту можно обратиться на любом этапе процесса исследования, начиная с первичного выбора системы измерения и плана и кончая подготовкой к публикации исследовательского отчета.
Возможно, имеет смысл несколько более подробно рассмотреть письменные источники. Я уже упоминал лучшие учебники по всему курсу статистики, а также по отдельном его темам. Некоторые статистические вопросы и соответствующие процедуры имеют особое значение в исследованиях в области психологии развития. В этой главе мы не рассматривали статистические процедуры, наиболее часто используемые в психологии развития; этому есть два объяснения: большинство вопросов статистики, с которыми имеет дело исследователь в области психологии развития, в действительности ничем не отличаются от вопросов, с которыми сталкиваются все исследователи-психологи; а те вопросы, которые все же специфичны для психологии развития, настолько сложны, что углубляться в них здесь не имеет смысла. Заметьте, однако, что есть полезные (хотя подчас весьма трудные) работы, посвященные статистическим процедурам, имеющим особое значение именно в психологии развития (см. например: Achenbach, 1978; Applebaum & MacCall, 1983; Collins & Horn, 1991; Nunnally, 1982).

























