Статистическое изучение вариации
Основные вопросы: 1. Понятие вариации.
2. Показатели вариации.
3. Относительные показатели вариации.
4. Виды дисперсии.
1. Понятие вариации. При изучении совокупности явления нельзя ограничиваться только нахождением средней величины. Средние величины дают обобщенную характеристику варьирующего признака, показывают типичные характеристики для изучаемой совокупности. Однако в средней величине не проявляется степень колеблемости отдельных значений признаков вокруг среднего уровня. В зависимости от однородности в совокупности колеблемость признаков может быть большой или малой. Поэтому возникает необходимость в измерении вариации отдельных вариантов по отношению к средней величине.
Определение: Вариация – это различие в значениях какого-либо признака у разных единиц данной совокупности в один и тот же период или момент времени.
Вариация в переводе с латинского означает «колеблемость», «изменчивость», «непостоянство». Предполагая, что большинство социально-экономических явлений и процессов варьируют в некотором масштабе, статистика разработала методологию расчета показателей вариации, которые, в свою очередь, могут быть абсолютными, относительными и средними.
Величины признаков колеблются, варьируют под действием различных причин и условий, которые в статистике называют факторами. Нередко эти факторы действуют в противоположных направлениях и сами, в свою очередь, варьируют. Среди них есть существенные факторы, определяющие величину вариантов данного признака у всех единиц совокупности. Но есть и несущественные, которые на одни единицы совокупности могут оказывать влияние, на другие нет.
Например, вариация оценок студентов на экзамене в вузе вызывается, в частности, различными способностями студентов; временем, затраченным ими на самостоятельную работу; посещаемостью занятий; различием социально-бытовых условий и т.д. Но на оценку могут влиять и какие-либо привходящие, чисто случайные причины, например, временное недомогание.
Вариация, порождаемая существенными факторами, носит систематический характер, то есть наблюдается последовательное изменение вариантов признака в определенном направлении. Такая вариация называется систематической. В систематической вариации проявляются взаимосвязи между явлениями, их признаками, в такой связи – один как причина, другой как следствие его действия.
Вариация, обусловленная случайными факторами, называется случайной вариацией. Здесь не наблюдается систематического изменения вариантов зависимого признака от случайных факторов; все изменения носят хаотический характер, поскольку нет устойчивой связи этих факторов с единицами изучаемой совокупности.
Вариация зависимого признака, образовавшаяся под действием всех без исключения влияющих на него факторов, называется общей вариацией. Следовательно, общая вариация слагается из систематической и случайной вариации.
Пример 1. Возьмем два варьирующих признака: возраст матерей и долю мальчиков среди детей, родившихся у матерей до 45-летнего возраста, полученные в результате социально-демографического обследования в 2002 г. в одном из регионов.
Таблица 15
Возраст матери, лет | Моложе 20 | 20–24 | 25–29 | 30–34 | 35–39 | 40–44 |
На 1000 девочек приходится мальчиков |
Из данных таблицы видно, что от возраста матери зависит доля мальчиков среди новорожденных. Здесь наблюдается систематическая вариация зависимого признака. Оба признака варьируют, но вариация зависимого признака идет в противоположном направлении по сравнению с вариацией факторного признака. Чем выше возраст матери, тем ниже доля мальчиков. Иначе говоря, по мере увеличения возраста матери вероятность рождения мальчика несколько уменьшается и в такой же мере возрастает вероятность рождения девочки.
Пример 2. Одинаковую работу выполняют две бригады, каждая из трех человек. Пусть количество деталей, шт., изготовленных за смену отдельными рабочими, составляло:
В первой бригаде – 95, 100, 105 ( )
Во второй бригаде – 75, 100, 125 ( ).
Средняя выработка на одного рабочего в обеих бригадах одинакова и составляет 100 шт., но колеблемость выработки отдельных рабочих в первой бригаде значительно меньше, чем во второй. Поэтому возникает необходимость измерять вариацию признака в совокупностях. Для этой цели в статистике применяют ряд обобщающих показателей.
2. Показатели вариации. К показателям вариации относятся: размах вариации, среднее линейное (абсолютное) отклонение (с.л.о.), дисперсия, среднее квадратическое отклонение (с.к.о.), коэффициент вариации.
1) Размах вариации – разность между максимальным и минимальным значением признака:
.
Он характеризует пределы изменения признака. В нашем примере размах вариации сменной выработки деталей для первой и второй бригад соответственно: =10 шт., =50 шт., что в 5 раз больше.
Это свидетельствует о том, что при численном равенстве средняя выработка первой бригады более устойчива. Размах вариации может служить базой расчета возможных резервов роста выработки. Таких резервов больше у второй бригады, поскольку в случае достижения всеми рабочими максимальной для этой бригады выработки деталей, ею может быть изготовлено 375 шт. ( ), а в первой – только 315 шт.
Средний размах: – это есть средняя арифметическая из ряда размахов, полученных из серии равных по объему наблюдений. Используется в контроле качества.
Однако размах вариации показывает лишь крайние отклонения признака и не отражает отклонений всех вариантов в ряду. При изучении вариации нельзя ограничиваться только определением размаха. Для анализа вариации необходим показатель, который отражает все колебания варьирующего признака и дает обобщенную характеристику.
Простейший показатель такого типа СЛО.
2). Среднее линейное отклонение (СЛО) – представляет собой среднюю арифметическую абсолютных значений отклонений отдельных вариантов от их средней арифметической (учитывает только крайние значения признака и не учитывает все промежуточные).
– СЛО для несгруппированных данных: ,
где – число членов ряда.
Т.е. – СЛО равно средней арифметической из абсолютных отклонений (модулей) признака всех единиц совокупности от средней арифметической.
– СЛО для сгруппированных данных: ,
где – сумма частот вариационного ряда.
В формулах разности в числителе взяты по модулю, иначе в числителе всегда будет ноль – алгебраическая сумма отклонений вариантов от их средней арифметической.
Поэтому СЛО применяют редко, только в случаях, когда суммирование показателей без учета знаков имеет экономический смысл. Например, анализ состава рабочих, ритмичность производства, оборот внешней торговли.
3) Дисперсия – это средний квадрат отклонений индивидуальных значений от средней арифметической (не имеет единиц измерения).
В общем виде взвешенная дисперсия исчисляется по формуле:
или простая дисперсия:
.
Дисперсия альтернативного признака:
Пример 3. Определить дисперсию, если из обследованных 200 деталей 10 – бракованные.
– доля бракованных деталей, – доля годных деталей.
.
4) Среднее квадратическое отклонение (СКО) ‑ это есть квадратный корень из среднего квадрата отклонений отдельных значений признака от средней арифметической:
– для несгруппированных данных;
– для сгруппированных данных (для вариационного ряда).
3. Относительные показатели вариации (коэффициент вариации). В статистической практике часто возникает необходимость сравнения вариаций различных признаков. Например, большой интерес представляет сравнение вариаций возраста рабочих и их квалификации, стажа работы и размера заработной платы, себестоимости и прибыли, стажа работы и производительности труда и т.д. для подобных сопоставлений показатели абсолютной колеблемости признаков непригодны: нельзя сравнивать колеблемость стажа работы, выраженного в годах, с вариацией зарплаты, выраженной в рублях.
Для осуществления такого сравнения, а также сравнения колеблемости одного и того же признака в нескольких совокупностях с различным средним арифметическим используют относительный показатель вариации – коэффициент вариации (КВ).
КВ – представляет собой выраженное в процентах отношение СКО к средней арифметической.
,
это и есть коэффициент вариации. Это относительная мера вариации и позволяет сравнивать степень варьирования в разных вариационных рядах.
Рассмотрим расчет показателей вариации.
Пример 4. По исходным данным определить: размах вариации, дисперсию, СКО, КВ.
Таблица 16
Группы работников по стажу, лет | Число работников в группе ( ), чел. |
1 – 4 4 – 7 7 – 10 | |
ИТОГО: |
Решение:
1) лет.
Остальные показатели требуют более трудоемких расчетов.
Таблица 17
Стаж, лет | Число работников ( ), чел. | Середина интервала ( ) | ||||
1 – 4 4 – 7 7 – 10 | 2,5 5,5 8,5 | 10,0 27,5 17,0 | –2,5 0,5 3,5 | 6,25 0,25 12,25 | 25,00 1,25 24,2 | |
ИТОГО | – | 54,5 | – | – | 50,75 |
– среднее значение находили ранее, оно равно 5 лет.
2) дисперсия: .
3) СКО: года.
4) КВ: .
Анализ полученных данных говорит о том, что стаж работников предприятия отличается от среднего стажа ( =5) в среднем на 2,1 года, или на 42 %. Значение коэффициента вариации превышает 33 %, следовательно, вариация производственного стажа велика, найденный средний производственный стаж плохо представляет всю совокупность работников, не является ее типичной, надежной характеристикой, а саму совокупность нет оснований считать однородной по производственному стажу.
4. Виды дисперсии.
Определение: Дисперсия – это средний квадрат отклонений всех значений признака ряда распределения от средней арифметической.
Свойства дисперсии:
1) Дисперсия постоянной величины равна нулю ( );
2) Дисперсия не меняется, если все варианты увеличить или уменьшить на одно и то же число ( );
3) Если все варианты умножить на число , дисперсия увеличится в раз ;
4) Дисперсия от средней меньше, чем средний квадрат отклонений от любого числа на – свойство минимальности дисперсии от средней ( ).
Использование свойств дисперсии позволяет упрощать ее расчеты, особенно в случаях, когда вариационный ряд составляет арифметическую прогрессию или имеет равные интервалы. В этих случаях сначала находят дисперсию от условного нуля, а затем используют 4-е свойство, переходят к дисперсии от средней.
Виды дисперсий для сгруппированных данных, условия их применения в статистических исследованиях.
Если совокупность данных сгруппирована на группы по какому-то признаку, то в этом случае выделяются 3 вида дисперсий:
- Общая дисперсия
– Средняя из внутригрупповых дисперсий
- Межгрупповая дисперсия
Общая - измеряет вариацию во всей совокупности
Средняя из внутригрупповых дисперсий исчисляется ,
где – частота появления внутригрупповой дисперсии одной величины (одного размера).
– внутригрупповая - измеряет вариацию признака внутри группы, - групповая средняя.
Межгрупповая дисперсия – измеряет колеблемость групповых средних вокруг общей средней :
Она измеряет вариацию, обусловленную признаком, положенным в основу группировки.
Правило сложения дисперсий.
Общий закон (правило) сложения дисперсий ‑ Общая дисперсия равна сумме средней из внутригрупповых дисперсий и межгрупповой дисперсии.
Показывает значение фактора, положенного в основу группировки (из всей совокупности факторов).
Коэффициент детерминации – есть квадрат эмпирического корреляционного отношения.
Эмпирическое корреляционное отношение – есть корень квадратный из отношения межгрупповой дисперсии к общей:
– характеризует влияние группировочного признака на результативный признак (оба показателя (числитель и знаменатель) не превышают по своей величине единицы: чем больше показатели в этих пределах, тем теснее взаимосвязь между изучаемыми признаками).
; – влияние других факторов равно 0.
– влияние признака равно 0.
Пример 5. Имеются следующие данные о зависимости выработки изделий работников от производственного стажа:
Таблица 18
Зависимость выработки работников от производственного стажа
Стаж, лет | Число работников, чел. | Выработка изделий в среднем на одного работника, шт. |
1 – 4 4 – 7 7 – 10 | 6,8 8,6 11,0 | |
ИТОГО: | 8,4 |
Определить: эмпирическое корреляционное отношение.
Решение: вычислим межгрупповую дисперсию по формуле:
.
Таблица 19
Стаж, лет | Число работников ( ) | Средняя выработка | |||
1 – 4 4 – 7 7 – 10 | 6,8 8,6 11,0 | -1,6 0,2 2,6 | 2,56 0,04 6,76 | 10,24 0,2 13,52 | |
ИТОГО: | 8,4 | - | – | 23,96 |
Теперь вычислим общую дисперсию выработки изделий на основе индивидуальных (несгруппированных) данных способом моментов: .
Таблица 20
Выработка изделий ( ), шт. | |
Итого: |
, тогда или 86,2%, .
Коэффициент детерминации говорит о том, что вариация выработки изделий на 86,2% зависит от вариации производственного стажа работников и на 13,8% от прочих факторов.
Эмпирическое корреляционное отношение по своей величине близко к единице, что свидетельствует о весьма тесной связи между стажем работников и их выработкой.
Лекция 7
Выборочное наблюдение
Основные вопросы: 1. Понятие о выборочном наблюдении.
2. Виды выборки.
3. Основные показатели выборки.
4. Ошибки выборки. Определение необходимого объема выборки.
5. Элементы дисперсионного анализа.
1. Понятие о выборочном наблюдении. Как известно, все исследования связаны с большими материальными и временными затратами. Для оптимизации исследований производится отбор изучаемых единиц совокупности. Такие исследования принято называть несплошным наблюдением.
Совокупность единиц, из которых производится отбор, называют генеральной совокупностью,а совокупность отобранных единиц из генеральной совокупности – выборочной совокупностью.
Наиболее известным способом несплошного наблюдения является выборочное наблюдение. Выделим преимущества такого способа наблюдения:
- экономия времени и средств в результате сокращения объема работы;
- сведение к минимуму порчи или уничтожения исследуемых объектов (определение прочности пряжи при разрыве, испытание электрических лампочек на продолжительность горения, проверка консервов на доброкачественность);
- необходимость детального исследования каждой единицы наблюдения при невозможности охвата всех единиц (при изучении бюджета семей);
- достижение большой точности результатов обследования благодаря сокращению ошибок, происходящих при регистрации.
Можно утверждать, что выборочное наблюдение при строгом соблюдении условий случайности и достаточно большой численности отобранных единиц репрезентативно (представительно); по результатам изучения определенной части единиц с достаточной для практики степенью точности можно судить по всей совокупности.
2. Виды выборки.
I. По степени охвата единиц изучаемой совокупности:
1) большая выборка ( ≥ 30);
2) малая выборка ( < 30).
II. По методу отбора:
1) повторная – общая численность единиц генеральной совокупности не изменяется и каждая исследуемая единица может вновь попасть в выборку;
2) бесповторная – общая численность единиц генеральной совокупности меняется (сокращается) и исследуемая единица не может вновь попасть в выборку.
III По виду отбора:
1) индивидуальная – отбираются отдельные единицы генеральной совокупности;
2) групповая – отбираются качественно однородные группы изучаемых единиц;
3) комбинированная – сочетание первого и второго видов.
IV По способу отбора (формирования):
1) собственно случайная (простая случайная) – осуществляется путем жеребьевки, на основе таблиц случайных чисел и т.п. При этом каждой единице генеральной совокупности обеспечивается одинаковая вероятность (возможность) быть выбранной. Единица отбора совпадает с единицей наблюдения.
Случайный отбор может быть проведен в двух формах:
а) в форме возвратной (повторной) выборки – вероятность попадания каждой единицы генеральной совокупности остается постоянной, так как после отбора какой-то единицы она снова возвращается в генеральную совокупность и может быть выбранной;
б) в форме безвозвратной (бесповторной) выборки – выбранная единица не возвращается в генеральную совокупность и вероятность попадания отдельных единиц в выборку все время изменяется (для оставшихся единиц она возрастает).
Применение простой случайной повторной выборки на практике весьма ограниченно; обычно используется бесповторная выборка;
2) механическая – когда упорядоченно–расположенные единицы выбираются через определенные интервалы.
Механическая выборка заключается в отборе единиц из генеральной совокупности через равные промежутки из определенного расположения их в генеральной совокупности (по алфавиту, в пространстве, последовательности появления во времени). Такая выборка применяется при контроле качества различных продуктов.
При организации механического отбора возникают две задачи:
- определение «шага отчета» (интервала выборки);
- выбор единицы, с которой надо начинать отчет.
«Шаг отчета» определяется путем деления численности генеральной совокупности на численность выборочной совокупности . Начала отчета находится путем случайного отбора из единиц первого интервала.
3) типическая (расслоенная или районированная) – всю совокупность предварительно разбивают на отдельные типические группы по какому-либо признаку, внутри группы проводится случайный или механический отбор в объеме пропорциональном численности единиц по группам в генеральной совокупности. Типический отбор обеспечивает наибольшую репрезентативность.
4) серийная (гнездовая) – производится отбор целых групп (серий, гнезд) единиц и внутри отобранных серий производится сплошное наблюдение. Серии (гнезда) состоят из единиц, связанных между собой или территориально, или организационно, или, наконец, во времени. Отбор серий может производиться в порядке повторного и бесповторного отбора. Серии могут быть равновеликими и неравновеликими. На практике чаще применяется серийный отбор с равными сериями.
5) комбинированная – предполагает использование нескольких способов выборки. Можно комбинировать, например, серийную выборку и случайную. В этом случае, разбив генеральную совокупность на серии (группы) и отобрав нужное число серий, производят случайную выборку единиц в серии. Такая комбинированная выборка может быть повторной (для групп и единиц) и бесповторной.
6) многоступенчатая выборка – предполагает извлечение из генеральной совокупности сначала укрупненных групп единиц, затем групп, меньших по объему, и так до тех пор, пока не будут отобраны те группы (серии) или отдельные единицы, которые будут подвергнуты наблюдению. Выборка может быть двухступенчатой, когда генеральная совокупность разбивается на группы и производится отбор групп, а затем внутри групп — отбор единиц наблюдения. На обеих ступенях отбор может вестись в случайном порядке. В отличие от типического отбора, где отбор производится из всех без исключения групп, при многоступенчатом отборе производится отбор самих групп, и, следовательно, не все они попадают в выборку.
3. Основные показатели выборки.
Таблица 21
Показатели | Определения | Генеральная совокупность | Выборочная совокупность |
Объем генеральной совокупности | Численность единиц всей совокупности | N | – |
Объем выборки | Число обследованных единиц | – | n |
Генеральная средняя | Среднее значение признака в генеральной совокупности | – | |
Выборочная средняя | Среднее значение признака в выборке | – | |
Генеральная доля | Доля единиц обладающих данным значением признака в общем числе единиц генеральной совокупности | p | – |
Выборочная доля | Доля единиц обладающих данным значением признака в общем числе единиц в выборке | – | |
Число единиц, обладающих изучаемым признаком | – | ||
Генеральная дисперсия | Дисперсия признака в генеральной совокупности | – | |
Выборочная дисперсия | Дисперсия признака в выборке | – |
4. Ошибки выборки. Определение необходимого объема выборки Ошибка выборки (ошибка репрезентативности) – это разность соответствующих выборочных и генеральных характеристик:
– для средней количественного признака;
– для доли (альтернативного признака).
Величина этих отклонений называется ошибкой наблюдения,которая складывается из ошибок двоякого рода: ошибки регистрации (точности) и ошибки репрезентативности.
При помощи формул теории вероятности можно рассчитать возможную максимальную случайную ошибку – вероятный (стохастический) предел ошибки.
Максимально возможная ошибка – это такая величина отклонения выборочной средней (доли) от генеральной, вероятность превышения которой вследствие случайных причин в условиях данной выборки очень мала.
Величина случайной ошибки репрезентативности зависит от:
• степени колеблемости изучаемого признака в генеральной совокупности;
• способа формирования выборочной совокупности;
• объема выборки.
Конечной целью выборочного наблюдения является характеристика генеральной совокупности на основе выборочных результатов. В каждой конкретной выборке расхождение между выборочной средней и генеральной может быть меньше средней ошибки выборки, равно ей или больше ее.
Предельную ошибку выборки можно найти на основе средней ошибки выборки:
.
Предельная ошибка выборки позволяет определить предельные значения характеристик генеральной совокупности и их доверительные интервалы:
– для средней;
– для доли.
Основные формулы для вычисления средних ошибок ( ) и необходимого объема выборки ( ) приведены в таблице, с использованием следующих обозначений:
, – межгрупповая дисперсия серийной выборки
– средние ошибки выборки на отдельных ступенях отбора,
– численность выборок на соответствующих ступенях.
Таблица 22
Формулы для вычисления средних ошибок и необходимого объема выборки
Вид отбора | Способ отбора единиц | Средняя ошибка μ | Объем выборки | ||
для средней | для доли | для средней | для доли | ||
Простая случайная выборка | повторный | ||||
бесповторный | |||||
Механическая выборка | Применяются формулы случайной бесповторной выборки | ||||
Типическая выборка | повторный | - для каждой группы; - число наблюдений в группе | |||
бесповторный | |||||
Серийная выборка | повторный | В зависимости от целей исследования | |||
бесповторный | |||||
Комбинированная выборка | повторный | В зависимости от комбинируемых методов | |||
бесповторный | |||||
Многоступенчатая выборка | В зависимости от целей исследования |
5. Элементы дисперсионного анализа. Дисперсионный анализ является одним из методов изучения влияния одного или нескольких факторных признаков на результативный признак. В зависимости от количества факторов дисперсионный анализ подразделяется на однофакторный и многофакторный. Ниже рассмотрено применение дисперсионного анализа для случая однофакторного комплекса.
В основе дисперсионного анализа лежит расчленение общей вариации изучаемого признака по источникам ее происхождения на два вида вариации:
систематическую вариацию, которая обусловлена изменением признака-фактора;
остаточную (случайную) вариацию, обусловленную действием прочих, случайных, не связанных с данным фактором обстоятельств.
Для разграничения этих вариаций всю совокупность наблюдавшихся единиц разбивают на группы (классы) по факторному признаку и исчисляют средние результативного признака по группам.
Групповые средние:
;
общая средняя:
где – индивидуальные значения признака в группе;
– число единиц, входящих в группу;
– общее число наблюдений.
Если сравнение групповых средних показывает определенное различие в их уровне, то необходимо установить, является ли это различие существенным и вызвано ли оно влиянием признака-фактора.
Для ответа на поставленный вопрос определяют два показателя дисперсии:
1) показатель , характеризующий колеблемость групповых средних вокруг общей средней (межгрупповая дисперсия);
2) показатель ,отражающий остаточную, внутригрупповую дисперсию. Полученные показатели сравнивают, получая фактическое дисперсионное отношение:
При дисперсионном анализе межгрупповую и внутригрупповую дисперсии определяют путем деления суммы квадратов отклонений на соответствующее число степеней свободы.
По таблице F-распределения Фишерапри определенном уровне значимости (или доверительной вероятности) и числе степеней свободы ( и )определяется табличное дисперсионное отношение ( ).
Если , то следует считать, что гипотеза о влиянии признака-фактора не опровергается.
Лекция 8