Авто Автоматизация Архитектура Астрономия Аудит Биология Бухгалтерия Военное дело Генетика География Геология Государство Дом Другое Журналистика и СМИ Изобретательство Иностранные языки Информатика Искусство История Компьютеры Кулинария Культура Лексикология Литература Логика Маркетинг Математика Машиностроение Медицина Менеджмент Металлы и Сварка Механика Музыка Население Образование Охрана безопасности жизни Охрана Труда Педагогика Политика Право Приборостроение Программирование Производство Промышленность Психология Радио Регилия Связь Социология Спорт Стандартизация Строительство Технологии Торговля Туризм Физика Физиология Философия Финансы Химия Хозяйство Ценнообразование Черчение Экология Эконометрика Экономика Электроника Юриспунденкция

V. Вариационные ряды, средние величины, вариабельность признака

Читайте также:

Особое место в статистическом анализе принадлежит определению среднего уровня изучаемого признака или явления. Средний уровень признака измеряют средними величинами.

Средняя величина характеризует общий количественный уровень изучаемого признака и является групповым свойством статистической совокупности. Она нивелирует, ослабляет случайные отклонения индивидуальных наблюдений в ту или иную сторону и выдвигает на первый план основное, типичное свойство изучаемого признака.

Средние величины широко используются:

1. Для оценки состояния здоровья населения: характеристики физического развития (рост, вес, окружность грудной клетки и пр.), выявления распространенности и длительности различных заболеваний, анализа демографических показателей (естественного движения населения, средней продолжительности предстоящей жизни, воспроизводства населения, средней численности населения и др.).

2. Для изучения деятельности лечебно-профилактических учреждений, медицинских кадров и оценки качества их работы, планирования и определения потребности населения в различных видах медицинской помощи (среднее число обращений или посещений на одного жителя в год, средняя длительность пребывания больного в стационаре, средняя продолжительность обследования больного, средняя обеспеченность врачами, койками и пр.).

3. Для характеристики санитарно-эпидемиологического состояния (средняя запыленность воздуха в цехе, средняя площадь на одного человека, средние нормы потребления белков, жиров и углеводов и т. д.).

4. Для определения медико-физиологических показателей в норме и патологии, при обработке лабораторных данных, для установления достоверности результатов выборочного исследования в социально-гигиенических, клинических, экспериментальных исследованиях.

Вычисление средних величин выполняется на основе вариационных рядов. Вариационный ряд – это однородная в качественном отношении статистическая совокупность, отдельные единицы которой характеризуют количественные различия изучаемого признака или явления.

Количественная вариация может быть двух типов: прерывная (дискретная) и непрерывная.

Прерывный (дискретный) признак выражается только целым числом и не может иметь никаких промежуточных значений (например, число посещений, численность населения участка, число детей в семье, степень тяжести болезни в баллах и др.).

Непрерывный признак может принимать любые значения в определенных пределах, в том числе и дробные, и выражается лишь приближенно (например, вес – для взрослых можно ограничиться килограммами, а для новорожденных – граммами; рост, артериальное давление, время, потраченное на прием больного, и т. д.).

Цифровое значение каждого отдельного признака или явления, входящего в вариационный ряд, называется вариантой и обозначается буквой V. В математической литературе встречаются и другие обозначения, например x или y.

Вариационный ряд, где каждая варианта указана один раз, называется простым. Такие ряды используются в большинстве статистических задач в случае компьютерной обработки данных.

При увеличении числа наблюдений, как правило, встречаются повторяющиеся значения вариант. В этом случае создается сгруппированный вариационный ряд, где указывается число повторений (частота, обозначается буквой «р»).

Ранжированный вариационный ряд состоит из вариант, расположенных в порядке возрастания или убывания. Как простой, так и сгруппированный ряды могут быть составлены с ранжированием.

Интервальный вариационный ряд составляют с целью упрощения последующих вычислений, выполняемых без использования компьютера, при очень большом числе единиц наблюдения (более 1000).

Непрерывный вариационный ряд включает значения вариант, которые могут выражаться любыми значениями.

Если в вариационном ряде значения признака (варианты) заданы в виде отдельных конкретных чисел, то такой ряд называют дискретным.

Общими характеристиками значений признака, отражаемого в вариационном ряду, являются средние величины. Среди них наиболее применяемые: средняя арифметическая величина М, мода Мо и медиана Me. Каждая из этих характеристик своеобразна. Они не могут подменить друг друга и лишь в совокупности достаточно полно и в сжатой форме представляют собой особенности вариационного ряда.

Модой (Мо) называют значение наиболее часто встречающейся варианты.

Медиана ( Me) – это значение варианты, делящей ранжированный вариационный ряд пополам (с каждой стороны медианы находится половина вариант). В редких случаях, когда имеется симметричный вариационный ряд, мода и медиана равны между собой и совпадают со значением средней арифметической.

Наиболее типичной характеристикой значений вариант является средняя арифметическая величина(М). В математической литературе она обозначается .

Средняя арифметическая величина (M, ) – это общая количественная характеристика определенного признака изучаемых явлений, составляющих качественно однородную статистическую совокупность. Различают среднюю арифметическую простую и взвешенную. Средняя арифметическая простая вычисляется для простого вариационного ряда путем суммирования всех вариант и делением этой суммы на общее количество вариант, входящих в данный вариационный ряд. Вычисления проводятся по формуле:

,

где: М - средняя арифметическая простая;

Σ V - сумма вариант;

n - число наблюдений.

В сгруппированном вариационном ряду определяют взвешенную среднюю арифметическую. Формула ее вычисления:

где: М - средняя арифметическая взвешенная;

Σ Vp - сумма произведений вариант на их частоты;

n - число наблюдений.

При большом числе наблюдений в случае ручных вычислений может применяться способ моментов.

Средняя арифметическая имеет следующие свойства:

· сумма отклонений вариант от средней (Σ d) равна нулю (см. табл. 15);

· при умножении (делении) всех вариант на один и тот же множитель (делитель) средняя арифметическая умножается (делится) на тот же множитель (делитель);

· если прибавить (вычесть) ко всем вариантам одно и то же число, средняя арифметическая увеличивается (уменьшается) на это же число.

Средние арифметические величины, взятые сами по себе, без учета вариабельности рядов, из которых они вычислены, могут не в полной мере отражать свойства вариационного ряда, в особенности когда необходимо сопоставление с другими средними. Близкие по значению средние могут быть получены из рядов с различной степенью рассеяния. Чем ближе друг к другу отдельные варианты по своей количественной характеристике, тем меньше рассеяние (колеблемость, вариабельность) ряда, тем типичнее его средняя.

Основными параметрами, которые позволяют оценить вариабельность признака, являются:

· Размах;

· Амплитуда;

· Среднее квадратическое отклонение;

· Коэффициент вариации.

Приблизительно о колеблемости признака можно судить по размаху и амплитуде вариационного ряда. Размах указывает на максимальную (V_max) и минимальную (V_min) варианты в ряду. Амплитуда (A_m) является разностью этих вариант: A_m = V_max - V_min.

Основной, общепринятой мерой колеблемости вариационного ряда являются дисперсия (D). Но наиболее часто применяется более удобный параметр, вычисляемый на основе дисперсии - среднее квадратическое отклонение (σ). Оно учитывает величину отклонения (d) каждой варианты вариационного ряда от его средней арифметической (d=V - M).

Поскольку отклонения вариант от средней могут быть положительными и отрицательными, то при суммировании они дают значение «0» (S d=0). Чтобы избежать этого, величины отклонения (d) возводятся во вторую степень и усредняются. Таким образом, дисперсия вариационного ряда является средним квадратом отклонений вариант от средней арифметической и вычисляется по формуле:

Она является важнейшей характеристикой вариабельности и применяется для вычисления многих статистических критериев.

Поскольку дисперсия выражается квадратом отклонений, ее величина не может использоваться в сопоставлении со средней арифметической. Для этих целей применяется среднее квадратическое отклонение, которое обозначается знаком «Сигма» (σ). Оно характеризует среднее отклонение всех вариант вариационного ряда от средней арифметической величины в тех же единицах, что и сама средняя величина, поэтому они могут использоваться совместно.

Среднее квадратическое отклонение определяют по формуле:

Указанная формула применяется при числе наблюдений (n) больше 30. При меньшем числе n значение среднего квадратического отклонения будет иметь погрешность, связанную с математическим смещением (n - 1). В связи с этим, более точный результат может быть получен с помощью учета такого смещения в формуле расчета стандартного отклонения:

стандартное отклонение (s) – это оценка среднеквадратического отклонения случайной величины Х относительно её математического ожидания на основе несмещённой оценки её дисперсии.

При значениях n > 30 среднее квадратическое отклонение (σ) и стандартное отклонение (s) будут одинаковыми (σ =s). Поэтому в большинстве практических пособий эти критерии рассматриваются как разнозначные. В программе Excel вычисление стандартного отклонения может быть выполнено функцией =СТАНДОТКЛОН(диапазон). А с целью расчета среднего квадратического отклонения требуется создать соответствующую формулу.

Среднее квадратическое или стандартное отклонение позволяет определить, насколько значения признака могут отличаться от среднего значения. Предположим, существуют два города с одинаковой средней дневной температурой в летний период. Один их этих городов расположен на побережье, а другой на континенте. Известно, что в городах, расположенных на побережье, различия дневных температур меньше, чем у городов, расположенных внутри континента. Поэтому среднее квадратическое отклонение дневных температур у прибрежного города будет меньше, чем у второго города. На практике это означает, что средняя температура воздуха каждого конкретного дня в городе, расположенного на континенте будет сильнее отличаться от среднего значения, чем в городе на побережье. Кроме того стандартное отклонение позволяет оценить возможные отклонения температуры от средней с требуемым уровнем вероятности.

[a11]

Согласно теории вероятности, в явлениях, подчиняющихся нормальному закону распределения, между значениями средней арифметической, среднего квадратического отклонения и вариантами существует строгая зависимость (правило трех сигм). Например, 68,3% значений варьирующего признака находятся в пределах М ± 1 σ, 95,5% — в пределах М ± 2 σ и 99,7% — в пределах М ± 3 σ.

Величина среднего квадратического отклонения позволяет судить о характере однородности вариационного ряда и исследуемой группы. Если величина среднего квадратического отклонения небольшая, то это свидетельствует о достаточно высокой однородности изучаемого явления. Среднюю арифметическую в таком случае следует признать вполне характерной для данного вариационного ряда. Однако слишком малая величина сигмы заставляет думать об искусственном подборе наблюдений. При очень большой сигме средняя арифметическая в меньшей степени характеризует вариационный ряд, что говорит о значительной вариабельности изучаемого признака или явления или о неоднородности исследуемой группы. Однако сопоставление величины среднего квадратического отклонения возможно только для признаков одинаковой размерности. Действительно, если сравнивать разнообразие веса новорожденных детей и взрослых, мы всегда получим более высокие значения сигмы у взрослых.

Сравнение вариабельности признаков различной размерности может быть выполнено с помощью коэффициента вариации. Он выражает разнообразие в процентах от средней величины, что позволяет производить сравнение различных признаков. Коэффициент вариации в медицинской литературе обозначается знаком «С», а в математической «v» и вычисляемого по формуле:

Значения коэффициента вариации менее 10% свидетельствует о малом рассеянии, от 10 до 20% – о среднем, более 20% – о сильном рассеянии вариант вокруг средней арифметической.

Средняя арифметическая величина, как правило, вычисляется на основе данных выборочной совокупности. При повторных исследованиях под влиянием случайных явлений средняя арифметическая может изменяться. Это обусловлено тем, что исследуется, как правило, только часть возможных единиц наблюдения, то есть выборочная совокупность. Информация обо всех возможных единицах, представляющих изучаемое явление, может быть получена при изучении всей генеральной совокупности, что не всегда возможно. В то же время с целью обобщения данных эксперимента представляет интерес величина средней в генеральной совокупности. Поэтому для формулировки общего вывода об изучаемом явлении, результаты, полученные на основе выборочной совокупности, должны быть, перенесены на генеральную совокупность статистическими методами.

Чтобы определить степень совпадения выборочного исследования и генеральной совокупности, необходимо оценить величину ошибки, которая неизбежно возникает при выборочном наблюдении. Такая ошибка называется «Ошибкой репрезентативности» или «Средней ошибкой средней арифметической». Она фактически является разностью между средними, полученными при выборочном статистическом наблюдении, и аналогичными величинами, которые были бы получены при сплошном исследовании того же объекта, т.е. при изучении генеральной совокупности. Поскольку выборочная средняя является случайной величиной, такой прогноз выполняется с приемлемым для исследователя уровнем вероятности. В медицинских исследованиях он составляет не менее 95%.

Ошибку репрезентативности нельзя смешивать с ошибками регистрации или ошибками внимания (описки, просчеты, опечатки и др.), которые должны быть сведены до минимума адекватной методикой и инструментами, применяемыми при проведении эксперимента.

Величина ошибки репрезентативности зависит как от объема выборки, так и от вариабельности признака. Чем больше число наблюдений, тем ближе выборка к генеральной совокупности и тем меньше ошибка. Чем более изменчив признак, тем больше величина статистической ошибки.

На практике для определения ошибки репрезентативности в вариационных рядах пользуются следующей формулой:

где: m – ошибка репрезентативности;

σ – среднее квадратическое отклонение;

n – число наблюдений в выборке.

Из формулы видно, что размер средней ошибки прямо пропорционален среднему квадратическому отклонению, т. е. вариабельности изучаемого признака, и обратно пропорционален корню квадратному из числа наблюдений.

При выполнении статистического анализа на основе вычисления относительных величин построение вариационного ряда не является обязательным. При этом определение средней ошибки для относительных показателей может выполняться по упрощенной формуле:

где: Р – величина относительного показателя, выраженного в процентах, промилле и т.д.;

q – величина, обратная Р и выраженная как (1-Р), (100-Р), (1000-Р) и т. д., в зависимости от основания, на которое рассчитан показатель;

n – число наблюдений в выборочной совокупности.

Однако, указанная формула вычисления ошибки репрезентативности для относительных величин может применяться только в том случае, когда значение показателя меньше его основания. В ряде случаев расчета интенсивных показателей такое условие не соблюдается, и показатель может выражаться числом более 100% или 1000%о. В такой ситуации выполняется построение вариационного ряда и вычисление ошибки репрезентативности по формуле для средних величин на основе среднего квадратического отклонения.

Прогнозирование величины средней арифметической в генеральной совокупности выполняется с указанием двух значений – минимального и максимального. Эти крайние значения возможных отклонений, в пределах которых может колебаться искомая средняя величина генеральной совокупности, называются «Доверительные границы».

Постулатами теории вероятностей доказано, что при нормальном распределении признака с вероятностью 99,7%, крайние значения отклонений средней будут не больше величины утроенной ошибки репрезентативности (М ± 3 m); в 95,5% – не больше величины удвоенной средней ошибки средней величины (М ± 2 m); в 68,3% – не больше величины одной средней ошибки (М ± 1 m) (рис. 9).

Рис. 9. Плотность вероятностей нормального распределения.

Отметим, что приведенное выше утверждение справедливо только для признака, который подчиняется нормальному закону распределения Гаусса.

Большинство экспериментальных исследований, в том числе и в области медицины, связано с измерениями, результаты которых могут принимать практически любые значения в заданном интервале, поэтому, как правило, описываются моделью непрерывных случайных величин. В связи с этим в большинстве статистических методов рассматриваются непрерывные распределения. Одним из таких распределений, имеющим основополагающую роль в математической статистике, является нормальное, или гауссово, распределение.

Это объясняется целым рядом причин.

1. Прежде всего, многие экспериментальные наблюдения можно успешно описать с помощью нормального распределения. Следует сразу же отметить, что не существует распределений эмпирических данных, которые были бы в точности нормальными, поскольку нормально распределенная случайная величина находится в пределах от до , чего никогда не встречается на практике. Однако нормальное распределение очень часто хорошо подходит как приближение.

Проводятся ли измерения веса, роста и других физиологических параметров организма человека - везде на результаты оказывает влияние очень большое число случайных факторов (естественные причины и ошибки измерения). [a12] Причем, как правило, действие каждого из этих факторов незначительно. Опыт показывает, что результаты именно в таких случаях будут распределены приближенно нормально.

2. Многие распределения, связанные со случайной выборкой, при увеличении объема последней переходят в нормальное.

3. Нормальное распределение хорошо подходит в качестве приближенного описания других непрерывных распределений (например, асимметричных).[a13]

4. Нормальное распределение обладает рядом благоприятных математических свойств, во многом обеспечивших его широкое применение в статистике.

В то же время следует отметить, что в медицинских данных встречается много экспериментальных распределений, описание которых моделью нормального распределения невозможно. Для этого в статистке разработаны методы, которые принято называть «Непараметрическими».

Выбор статистического метода, который подходит для обработки данных конкретного эксперимента, должен производиться в зависимости от принадлежности полученных данных к нормальному закону распределения. Проверка гипотезы на подчинение признака нормальному закону распределения выполняется с помощью гистограммы распределения частот (графика), а также ряда статистических критериев. Среди них:

- Критерий асимметрии (b);

- Критерий проверки на эксцесс (g);

- Критерий Шапиро – Уилкса (W).

Анализ характера распределения данных (его еще называют проверкой на нормальность распределения) осуществляется по каждому параметру. Чтобы уверенно судить о соответствии распределения параметра нормальному закону, необходимо достаточно большое число единиц наблюдения (не менее 30 значений).

Для нормального распределения критерии асимметрии и эксцесса принимают значение 0. Если распределение смещено вправо b > 0 (положительная асимметрия), при b < 0 - график распределения смещен влево (отрицательная асимметрия). Критерий асимметрии проверяет форму кривой распределения. В случае нормального закона g =0. При g > 0 кривая распределения острее, если g < 0 пик более сглаженный, чем функция нормального распределения.

Для проверки на нормальность по критерию Шапиро – Уилкса требуется найти значение этого критерия по статистическим таблицам при необходимом уровне значимости и в зависимости от числа единиц наблюдения (степеней свободы). Приложение 1. Гипотеза о нормальности отвергается при малых значениях этого критерия, как правило, при w <0,8.

Пример построения вариационных рядов, вычисления средних величин, создания графика распределения признака и проверки на нормальность распределения.

Условие задачи: Для выявления общей характеристики частоты сердечных сокращений (ЧСС) детей 1-го года жизни в отделении №1 больницы выполнено 16 измерений пульса у детей:

1. Иванов Василий – 120 уд.в мин.

2. Сидоров Костя – 130 – “ -

3.... - 115

4.... - 120

5.... - 120

6.... - 125

7.... - 110

8.... - 125

9.... - 115

10.... - 120

11.... - 125

12.... - 135

13.... - 115

14.... - 130

15.... - 125

16.... - 120

Задание: а) составьте простой не ранжированный вариационный ряд, вычислите среднюю арифметическую величину и определите степень рассеяния вариант в вариационном ряду;

б) выполите упорядочение (ранжирование) ряда по возрастанию и определите медиану;

в) составьте сгруппированный ранжированный вариационный ряд, постройте график распределения признака, определите моду и среднюю взвешенную величину;

г) определите вид распределения признака и статистические критерии нормальности распределения;

д) вычислите ошибку репрезентативности и доверительные границы колебания средней арифметической в генеральной совокупности.

[a14]

Решение: запустите программу Excel, откройте файл в папке своей учебной группы под именем «Статистика–Фамилии студентов». Создайте НОВЫЙ лист, переименуйте его, обозначив названием «Сред_вел». На этом листе введите данные и решение задачи, как показано ниже, сохраните изменения и покажите результат работы преподавателю.

а) Построение простого вариационного ряда частоты пульса детей, поступивших в отделение №1 больницы. Простой вариационный ряд представляет собой таблицу, в которой подлежащим является изучаемый признак, обозначаемый знаком V (варианта). Все полученные в эксперименте данные вносят в таблицу в порядке их записи в журнал регистрации (условия задачи). Если значения вариант повторяются, то каждое из них заносится в отдельную ячейку таблицы. Затем вычисляют сумму вариант, среднюю арифметическую, отклонения (d) каждой варианты от средней величины и квадрат отклонения (d²) соответствующими формулами (таблица 13).

Таблица 13

Простой не ранжированный вариационный ряд

	V	d=V-M	d²
1 Иванов Василий		-1,88	3,52
2 Сидоров Костя		8,13	66,02
3 …		-6,88	47,27
4 …		-1,88	3,52
5 …		-1,88	3,52
6 …		3,13	9,77
7 …		-11,88	141,02
8 …		3,13	9,77
9 …		-6,88	47,27
10 …		-1,88	3,52
11 …		3,13	9,77
12 …		13,13	172,27
13 …		-6,88	47,27
14 …		8,13	66,02
15 …		3,13	9,77
16 …		-1,88	3,52
Сумма (S) =	1950	0,00	643,75
n= 16

Вычисление средней арифметической (M) в простом вариационном ряду выполняется по формуле:

= 1950/16 = 121,9 уд/мин.

В программе Excel для вычисления средней арифметической может применяться функция =СРЗНАЧ(Диапазон ячеек). Использование этой функции даст такой же результат.

Определение степени рассеяния вариант в вариационном ряду с помощью среднего квадратического отклонения (σ - Сигма) и коэффициента вариации (С). Среднее квадратическое отклонения вычисляется по формуле:

= КОРЕНЬ(643,75 / 16) = ± 6,343.

Для упрощения расчета среднего квадратического отклонения при n > 30 в программе Excel может использоваться функция =СТАНДОТКЛОН(Диапазон). Если выполнить вычисления этой функцией в нашем вариационном ряду, то будет получено значение стандартного отклонения = 6,55. Это значение отличается от величины среднего квадратического отклонения, что обусловлено малым числом наблюдений (n = 16).

Коэффициент вариации (С) вычисляется формулой:

= 6,343/121,9 * 100 = 5,2%, что является малым рассеянием (<10%).

Вариабельность признака (рассеяние) оценивается как малая при С <10%, средняя при 10%< С < 20%, высокая при С >20%

1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 | 11 | 12 | 13 | 14 | 15 | 16 | 17 | 18 | 19 | 20 | 21 | 22 | 23 | 24 | 25 | 26 | 27 | 28 | 29 | 30 |

Поиск по сайту:

Все материалы представленные на сайте исключительно с целью ознакомления читателями и не преследуют коммерческих целей или нарушение авторских прав. Студалл.Орг (0.021 сек.)

Главная | О проекте | Полезные cсылки | Контакты | Случайная страница