Признаки, изучаемые статистикой, варьируются (отличаются друг от друга) у различных единиц совокупности в один и тот же период или момент времени. Например, величина внешнеторгового оборота варьируется по подразделениям ФТС; величина экспорта (импорта) варьируется по направлениям экспорта (по разным странам-партнерам по внешней торговле), по видам товаров и т.п.
Причиной вариации являются разные условия существования разных единиц совокупности. Например, огромное число причин влияет на масштабы внешней торговли различных стран мира.
Для управления и изучения вариации статистикой разработаны специальные методы исследования вариации, система показателей, с помощью которой вариация измеряется, характеризуются ее свойства.
Первым этапом статистического изучения вариации является построение ряда распределения (или вариационного ряда ) – упорядоченного распределения единиц совокупности по возрастающим (чаще) или по убывающим (реже) значениям признака и подсчет числа единиц с тем или иным значением признака.
Существует 3 вида ряда распределения:
1) ранжированный ряд – это перечень отдельных единиц совокупности в порядке возрастания изучаемого признака (например, таблица 11); если численность единиц совокупности достаточно велика ранжированный ряд становится громоздким, и в таких случаях ряд распределения строится с помощью группировки единиц совокупности по значениям изучаемого признака (ели признак принимает небольшое число значений, то строится дискретный ряд, а в противном случае – интервальный ряд);
2) дискретный ряд – это таблица, состоящая из двух столбцов (строк) – конкретных значений варьирующего признака Xi и числа единиц совокупности с данным значением признака fi – частот; число групп в дискретном ряду определяется числом реально существующих значений варьирующего признака;
3) интервальный ряд – это таблица, состоящая из двух столбцов (строк) – интервалов варьирующего признака Xi и числа единиц совокупности, попадающих в данный интервал (частот), или долей этого числа в общей численности совокупностей (частостей).
Построим ряд распределения внешнеторгового оборота (ВО) по таможенным постам России, для чего необходимо провести статистическое наблюдение, то есть собрать первичный статистический материал, который представляет собой величину ВО по таможенным постам.
Результаты наблюдения ВО по 35 таможенным постам региона за отчетный период представим в виде ранжированного по возрастанию величины ВО ряда распределения (таблица 11).
Таблица 11. Внешнеторговый оборот (ВО) по 35 таможенным постам, млн.долл.
|
№ поста |
№ поста |
№ поста |
|||
Определим средний размер ВО по формуле (10), приняв за X величину ВО, а за N – численность постов:
= = 2100/35 = 60 (млн.долл.)
Дисперсию (о ней будет рассказано чуть позднее – на 4-м этапе анализа вариации в этой теме) определим по формуле (28):
= = 445,778 (млн.долл.2)
Построим интервальный ряд распределения ВО по таможенным постам, для чего необходимо выбрать оптимальное число групп (интервалов признака) и установить длину (размах) интервала. Поскольку при анализе ряда распределения сравнивают частоты в разных интервалах, необходимо, чтобы длина интервалов была постоянной . Оптимальное число групп выбирается так, чтобы достаточной мере отразилось разнообразие значений признака в совокупности и в то же время закономерность распределении, его форма не искажалась случайными колебаниями частот. Если групп будет слишком мало, не проявится закономерность вариации; если групп будет чрезмерно много, случайные скачки частот исказят форму распределения.
Чаще всего число групп в ряду распределения определяют по формуле Стерждесса (19) или (20):
(19) или ,(20)
где k – число групп (округляемое до ближайшего целого числа); N – численность совокупности.
Из формулы Стерджесса видно, что число групп – функция объема данных (N ).
Зная число групп, рассчитывают длину (размах) интервала по формуле (21):
,(21)
где X мax и X min - максимальное и минимальное значения в совокупности.
В нашем примере про ВО по формуле Стерждесса (19) определим число групп:
k = 1 + 3,322lg 35 = 1+ 3,322*1,544 = 6,129 ≈ 6.
Рассчитаем длину (размах) интервала по формуле (21):
h = (111,16 – 24,16)/6 = 87/6 = 14,5 (млн.долл.).
Теперь построим интервальный ряд с 6 группами с интервалом 14,5 млн.долл. (см. первые 3 столбца табл. 12).
Таблица 12. Интервальный ряд распределения ВО по таможенным постам, млн.долл.
|
Группы постов по величине ВО |
Число постов |
Середина интервала |
Х i’fi |
Накопл. частота |
| Хi ’ - | fi |
(Х i ’ - )2 fi |
(Х i ’ - )3 fi |
(Х i ’ - )4 fi |
|
|
96,66 – 111,16 |
|||||||||
Существенную помощь в анализе ряда распределения и его свойств оказывает графическое изображение. Интервальный ряд изображается столбиковой диаграммой, в которой основания столбиков, расположенные по оси абсцисс, – это интервалы значений варьирующего признака, а высоты столбиков – частоты, соответствующие масштабу по оси ординат. Графическое изображение распределения таможенных постов в выборке по величине ВО приведено на рис. 4. Диаграмма такого типа называется гистограммой .
Рис. 4. Гистограмма распределения Рис. 5. Полигон распределения
Данные табл. 12 и рис. 4 показывают характерную для многих признаков форму распределения: чаще встречаются значения средних интервалов признака, реже – крайние (малые и большие) значения признака. Форма этого распределения близка к нормальному закону распределения, которое образуется, если на варьирующую переменную влияет большое число факторов, ни один из которых не имеет преобладающего значения.
Если имеется дискретный ряд распределения или используются середины интервалов (как в нашем примере про ВО – в таблице 12 в 4-м столбце рассчитаны середины интервалов как полусумма значений начала и конца интервала), то графическое изображение такого ряда называется полигоном (см. рис. 5) , которое получается соединением прямыми точек с координатами Xi и fi .
Во многих случаях, кота статистическая совокупность включает большое или тем более бесконечное число вариант, что чаще всего встречается при непрерывной вариации, практически невозможно и нецелесообразно формировать группу единиц для каждой варианты. В таких случаях объединение статистических единиц в группы возможно лишь на базе интервала, т.е. такой группы, которая имеет определенные пределы значений варьирующего признака. Эти пределы обозначаются двумя числами, указывающими верхнюю и нижнюю границы каждой группы. Применение интервалов приводит к формированию интервального ряда распределения.
Интервальный рад - это вариационный ряд, варианты которого представлены в виде интервалов.
Интервальный ряд может формироваться с равными инеравными интервалами, при этом выбор принципа построения этого ряда зависит главным образом от степени представительности и удобности статистической совокупности. Если совокупность достаточно велика (представительна) по числу единиц и вполне однородна по своему составу, то в основу формирования интервального ряда целесообразно положить равенства интервалов. Обычно по этому принципу образуют интервальный ряд по тем совокупностям, где размах вариации сравнительно невелик, т.е. максимальная и минимальная варианты различаются между собой обычно в несколько раз. При этом величина равных интервалов рассчитывается отношением размаха вариации признака к заданному числу образуемых интервалов. Для определения равного и нтервала может быть ииспользована формула Стерджесса (обычно при небольшой вариации интервальных признаков и большом числе единиц в статистической совокупности):
где х i - величина равного интервала; X max, X min- максимальная и минимальная варианты в статистической совокупности; n. - число единиц в совокупности.
Пример . Целесообразно рассчитать размер равного интервала по плотности радиоактивного загрязнения цезием – 137 в 100 населенных пунктах Краснопольского района Могилевской области, если известно, что начальная (минимальная) варианта равна I км/км 2 , конечная (максимальная) - 65 ки/км 2 . Воспользовавшись формулой 5.1. получим:
Следовательно, чтобы сформировать интервальный ряд с равными интервалами по плотности загрязнения цезием - 137 населенных пунктов Краснопольского района, размер равного интервала может составить 8 ки/км 2 .
В условиях неравномерного распределения т.е. когда максимальная иминимальная варианты сотни раз, при формировании интервального ряда можно применить принцип неравных интервалов. Неравные интервалы обычно увеличиваются по мере перехода к большим значениям признака.
По форме интервалы могут быть закрытыми и открытыми. Закрытыми принято называть интервалы, у которых обозначены как нижняя, так и верхняя границы. Открытые интервалы имеют только одну границу: в первом интервале – верхняя, в последнем - нижняя граница.
Оценку интервальных рядов, особенно с неравным интервалами, целесообразно проводить с учетом плотности распределения , простейшим способом расчета которого является отношение локальной частоты (или частости) к размеру интервала.
Для практического формирования интервального ряда можно воспользоваться макетом табл. 5.3.
Т а б л и ц а 5.3. Порядок формирования интервального ряда населённых пунктов Краснопольского района по плотности радиоактивного загрязнения цезием –137
Основное преимущество интервального ряда - его предельная компактность. в то же время в интервальном ряду распределения индивидуальные варианты признака скрыты в соответствующих интервалах
При графическом изображении интервального ряда в системе прямоугольных координат на оси абсцисс откладывают верхние границы интервалов, на ос ординат - локальные частоты ряда. Графическое построение интервального ряда отличается от построения полигона распределения тем, что каждый интервал имеет нижнюю и верхнею границы, а одному какому- либо значению ординаты соответствуют две абсциссы. Поэтому на графике интервального ряда отмечается не точка, как в полигоне, а линия, соединяющая две точку. Эти горизонтальные линии соединяются друг с другом вертикальными линиями и получается фигура ступенчатого многоугольника, который принято называть гистограммой распределения (рис.5.3).
При графическом построении интервального ряда по достаточно большой статистической совокупности гистограмма приближается к симметричной форме распределения. В тех же случаях, где статистическая совокупность невелика, как правило, формируется асимметричная гистограмма.
В некоторых случаях имеется целесообразность в формировании ряда накопленных частот, т.е. кумулятивного ряда. Кумулятивный ряд можно образовать на основе дискретного либо интервального ряда распределения. При графическом изображении кумулятивного ряда в системе прямоугольных координат на оси абсцисс откладывают варианты, на оси ординат - накопленные частоты (частости). Полученную при этом кривую линию принято называть кумулятой распределения (рис.5.4).
Формирование и графическое изображение различных видов вариационных рядов способствует упрощенному расчету основных статистических характеристик, которые подробно рассматриваются в теме 6, помогает лучше понять сущность законов распределения статистической совокупности. Анализ вариационного ряда приобретает особенное значение в тех случаях, когда необходимо выявить и проследить зависимость между вариантами и частотами (частостями). Эта зависимость проявляется в том, что число случаев, приходящихся на каждую варианту, определенным образом связано с величиной этой варианты, т.е. с возрастанием значений варьирующего признака частоты (частости) этих значений испытывают определенные, систематические изменения. Это означает, что числа в столбце частот (частостей) подвержены не хаотическим колебаниям, а изменяются в определенном направлении, в определенном порядке и последовательности.
Если частоты в своих изменениях обнаруживают определенную систематичность, то это означает, что мы находимся на пути к выявлению закономерности. Система, порядок, последовательность в изменении частот - это отражение общих причин, общих условий, характерных для всей совокупности.
Не следует считать, что закономерность распределения всегда дается в готовом виде. Встречается довольно много вариационных рядов, в которых частоты причудливо скачут, то возрастая, то уменьшаясь. В таких случаях целесообразно выяснить, с каким распределением имеет дело исследователь: то ли этому распределению вовсе не присущи закономерности, то его характер еще не выявлен: Первый случай встречается редко, второй же, второй же случай - явление довольно частое и весьма распространенное.
Так, при формировании интервального ряда общее число статистических единиц может быть небольшим, и в каждый интервал попадает малое число вариант (например, 1-3 единицы). В таких случаях рассчитывать на проявление какой-либо закономерности не приходится. Для того чтобы на основе случайных наблюдений получился закономерный результат, необходимо вступление в силу закона больших чисел, т.е. чтобы на каждый интервал приходилось бы не несколько, а десятки и сотни статистических единиц. С этой целью надо стараться, по возможности увеличивать число наблюдений. Это самый верный способ обнаружения закономерности в массовых процессах. Если же не представляется реальная возможность увеличить число наблюдений, то выявление закономерности может быть достигнуто уменьшением числа интервалов в ряду распределения. Уменьшая число интервалов в вариационном ряду, тем самым увеличивается численность частот в каждом интервале. Это означает, что случайные колебания каждой статистической единицы накладываются друг на друга, "сглаживается", превращаясь в закономерность.
Формирование и построение вариационных рядов позволяет получить лишь общую, приближенную картину распределения статистической совокупности. Например, гистограмма лишь в грубой форме выражает зависимость между значениями признака и его частотами (частостями) Поэтому вариационные ряды по существу являются лишь основой для дальнейшего, углубленного изучения внутренней закономерности статического распределения.
КОНТРОЛЬНЫЕ ВОПРОСЫ К ТЕМЕ 5
1. Что представляет собой вариация? Чем вызывается вариация признака в статистической совокупности?
2. Какие виды варьирующих признаков могут иметь место в статистике?
3. Что такое вариационный ряд? Какие могут быть виды вариационных рядов?
4. Что представляет собой ранжированный ряд? Какие его преимущества и недостатки?
5. Что такое дискретный ряд и какие его преимущества и недостатки?
6. Каков порядок формирования интервального ряда, какие его преимущества и недостатки?
7. Что представляет собой графическое изображение ранжированного, дискретного, интервального рядов распределения?
8. Что такое кумулята распределения и что она характеризует?
Наиболее простым способом обобщения статистического материала является построение рядов. Результатом сводки статистического исследования могут быть ряды распределения. Рядом распределения в статистике называется упорядоченное распределение единиц совокупности на группы по какому-либо одному признаку: по качественному или количественному. Если ряд построен по качественному признаку, то он называется атрибутивным, а если по количественному признаку, то вариационный.
Вариационный ряд характеризуется двумя элементами: вариантой (Х) и частотой (f). Варианта – это отдельное значение признака отдельной единицы или группы совокупности. Число, показывающее, сколько раз встречается то или иное значение признака, называется частотой. Если частота выражена относительным числом, то она называется частостью. Вариационный ряд может быть интервальным, когда определены границы «от» и «до», а может быть дискретным, когда изучаемый признак характеризуется определенным числом.
Построение вариационных рядов рассмотрим на примерах.
Пример . и меются данные о тарифных разрядах 60 рабочих одного их цехов завода.
Распределить рабочих по тарифному разряду, построить вариационный ряд.
Для этого выпишем все значения признака в порядке возрастания и посчитаем число рабочих в каждой группе.
Таблица 1.4
Распределение рабочих по разряду
|
Разряд рабочих (X) |
Число рабочих |
|
|
человек (f) |
в % к итогу (частность) |
|
Мы получили вариационный дискретный ряд, в котором изучаемый признак (разряд рабочего) представлен определенным числом. Для наглядности вариационные ряды изображают графически. На основании данного ряда распределения построили поверхность распределения.
Рис. 1.1. Полигон распределения рабочих по тарифному разряду
Построение интервального ряда с равными интервалами рассмотрим на следующем примере.
Пример . Известны данные о стоимости основного капитала 50 фирм в млн руб. Требуется показать распределение фирм по стоимости основного капитала.
Чтобы показать распределение фирм по стоимости основного капитала, сначала решим вопрос о количестве групп, которые хотим выделить. Предположим, решили выделить 5 групп предприятий. Затем определим величину интервала в группе. Для этого воспользуемся формулой
Согласно нашему примеру .
Путем прибавления величины интервала к минимальному значению признака, получим группы фирм по стоимости основного капитала.
Единица, обладающая двойным значением, относится к той группе, где она выступает в роли верхней границы (т.е. значение признака 17 пойдет в первую группу, 24 – во вторую и т.д.).
Подсчитаем число заводов в каждой группе.
Таблица 1.5
Распределение фирм по стоимости основного капитала (млн руб.)
|
Стоимость основного капитала |
Число фирм |
Накопленные частоты |
Согласно данному распределению получили вариационный интервальный ряд, из которого следует, что 36 фирм имеют основной капитал стоимостью от 10 до 24 млн руб. и т.д.
Интервальные ряды распределения можно представить графически в виде гистограммы.
Результаты обработки данных оформляются в статистические таблицы . Статистические таблицы содержат свое подлежащее и сказуемое.
Подлежащее – это та совокупность или часть совокупности, которая подвергается характеристике.
Сказуемое – это показатели, характеризующие подлежащее.
Таблицы различают: простые и групповые, комбинационные, с простой и сложной разработкой сказуемого.
Простая таблица в подлежащем содержит перечень отдельных единиц.
Если же в подлежащем имеется группировка единиц, то такая таблица называется групповой. Например, группа предприятий по числу рабочих, группы населения по полу.
В подлежащем комбинационной таблицы содержится группировка по двум или нескольким признакам. Например, население по полу разделяется на группы по образованию, возрасту и т.д.
Комбинационные таблицы содержат информацию, позволяющую выявить и охарактеризовать взаимосвязь ряда показателей и закономерность их изменения как в пространстве, так и во времени. Чтобы таблица была наглядной при разработке ее подлежащего, ограничиваются двумя-тремя признаками, образуя по каждому из них ограниченное число групп.
Сказуемое в таблицах может быть разработано по-разному. При простой разработке сказуемого все его показатели располагаются независимо друг от друга.
При сложной разработке сказуемого показатели сочетаются друг с другом.
При построении любой таблицы нужно исходить из целей исследования и содержания обработанного материала.
Кроме таблиц в статистике используются графики и диаграммы. Диаграмма – статистические данные изображаются с помощью геометрических фигур. Диаграммы подразделяются на линейные и столбиковые, но могут быть фигурные диаграммы (рисунки и символы), круговые диаграммы (окружность принимается за величину всей совокупности, а площади отдельных секторов отображают удельный вес или долю ее составных частей), радиальные диаграммы (строятся на базе полярных ординат). Картограмма представляет собой сочетание контурной карты или плана местности с диаграммой.
Важнейшим этапом исследования социально-экономических явлений и процессов является систематизация первичных данных и получение на этой основе сводной характеристики всего объекта при помощи обобщающих показателей, что достигается путем сводки и группировки первичного статистического материала.
Статистическая сводка - это комплекс последовательных операций по обобщению конкретных единичных фактов, образующих совокупность, для выявления типичных черт и закономерностей, присущих изучаемому явлению в целом. Проведение статистической сводки включает следующие этапы :
- выбор группировочного признака;
- определение порядка формирования групп;
- разработка системы статистических показателей для характеристики групп и объекта в целом;
- разработка макетов статистических таблиц для представления результатов сводки.
Статистической группировкой называется расчленение единиц изучаемой совокупности на однородные группы по определенным существенным для них признакам. Группировки являются важнейшим статистическим методом обобщения статистических данных, основой для правильного исчисления статистических показателей.
Различают следующие виды группировок: типологические, структурные, аналитические. Все эти группировки объединяет то, что единицы объекта разделены на группы по какому-либо признаку.
Группировочным признаком называется признак, по которому проводится разбиение единиц совокупности на отдельные группы. От правильного выбора группировочного признака зависят выводы статистического исследования. В качестве основания группировки необходимо использовать существенные, теоретически обоснованные признаки (количественные или качественные).
Количественные признаки группировки имеют числовое выражение (объем торгов, возраст человека, доход семьи и т. д.), а качественные признаки группировки отражают состояние единицы совокупности (пол, семейное положение, отраслевая принадлежность предприятия, его форма собственности и т. д.).
После того, как определено основание группировки следует решить вопрос о количестве групп, на которые надо разбить исследуемую совокупность. Число групп зависит от задач исследования и вида показателя, положенного в основание группировки, объема совокупности, степени вариации признака.
Например, группировка предприятий по формам собственности учитывает муниципальную, федеральную и собственность субъектов федерации. Если группировка производится по количественному признаку, то тогда необходимо обратить особое внимание на число единиц исследуемого объекта и степень колеблемости группировочного признака.
Когда определено число групп, то следует определить интервалы группировки. Интервал - это значения варьирующего признака, лежащие в определенных границах. Каждый интервал имеет свою величину, верхнюю и нижнюю границы или хотя бы одну из них.
Нижней границей интервала называется наименьшее значение признака в интервале, а верхней границей - наибольшее значение признака в интервале. Величина интервала представляет собой разность между верхней и нижней границами.
Интервалы группировки в зависимости от их величины бывают: равные и неравные. Если вариация признака проявляется в сравнительно узких границах и распределение носит равномерный характер, то строят группировку с равными интервалами. Величина равного интервала определяется по следующей формуле :
где Хmax, Хmin - максимальное и минимальное значения признака в совокупности; n - число групп.
Простейшая группировка, в которой каждая выделенная группа характеризуется одним показателем представляет собой ряд распределения.
Статистический ряд распределения - это упорядоченное распределение единиц совокупности на группы по определенному признаку. В зависимости от признака, положенного в основу образования ряда распределения, различают атрибутивные и вариационные ряды распределения.
Атрибутивными называют ряды распределения, построенные по качественным признакам, то есть признакам, не имеющим числового выражения (распределение по видам труда, по полу, по профессии и т.д.). Атрибутивные ряды распределения характеризуют состав совокупности по тем или иным существенным признакам. Взятые за несколько периодов, эти данные позволяют исследовать изменение структуры.
Вариационными рядами называют ряды распределения, построенные по количественному признаку. Любой вариационный ряд состоит из двух элементов: вариантов и частот. Вариантами называются отдельные значения признака, которые он принимает в вариационном ряду, то есть конкретное значение варьирующего признака.
Частотами называются численности отдельных вариант или каждой группы вариационного ряда, то есть это числа, которые показывают, как часто встречаются те или иные варианты в ряду распределения. Сумма всех частот определяет численность всей совокупности, ее объем. Частостями называются частоты, выраженные в долях единицы или в процентах к итогу. Соответственно сумма частостей равна 1 или 100%.
В зависимости от характера вариации признака различают три формы вариационного ряда: ранжированный ряд, дискретный ряд и интервальный ряд.
Ранжированный вариационный ряд - это распределение отдельных единиц совокупности в порядке возрастания или убывания исследуемого признака. Ранжирование позволяет легко разделить количественные данные по группам, сразу обнаружить наименьшее и наибольшее значения признака, выделить значения, которые чаще всего повторяются.
Дискретный вариационный ряд характеризует распределение единиц совокупности по дискретному признаку, принимающему только целые значения. Например, тарифный разряд, количество детей в семье, число работников на предприятии и др.
Если признак имеет непрерывное изменение, которые в определенных границах могут принимать любые значения («от - до»), то для этого признака нужно строить интервальный вариационный ряд . Например, размер дохода, стаж работы, стоимость основных фондов предприятия и др.
Примеры решения задач по теме «Статистическая сводка и группировка»
Задача 1 . Имеется информация о количестве книг, полученных студентами по абонементу за прошедший учебный год.
Построить ранжированный и дискретный вариационные ряды распределения, обозначив элементы ряда.
Решение
Данная совокупность представляет собой множество вариантов количества получаемых студентами книг. Подсчитаем число таких вариантов и упорядочим в виде вариационного ранжированного и вариационного дискретного рядов распределения.
Задача 2 . Имеются данные о стоимости основных фондов у 50 предприятий, тыс. руб.
Построить ряд распределения, выделив 5 групп предприятий (с равными интервалами).
Решение
Для решения выберем наибольшее и наименьшее значения стоимости основных фондов предприятий. Это 30,0 и 10,2 тыс. руб.
Найдем размер интервала: h = (30,0-10,2):5= 3,96 тыс. руб.
Тогда в первую группу будут входить предприятия, размер основных фондов которых составляет от 10,2 тыс. руб. до 10,2+3,96=14,16 тыс. руб. Таких предприятий будет 9. Во вторую группу войдут предприятия, размер основных фондов которых составит от 14,16 тыс. руб. до 14,16+3,96=18,12 тыс. руб. Таких предприятий будет 16. Аналогично найдем число предприятий, входящих в третью, четвертую и пятую группы.
Полученный ряд распределения поместим в таблицу.
Задача 3 . По ряду предприятий легкой промышленности получены следующие данные:
Произведите группировку предприятий по числу рабочих, образуя 6 групп с равными интервалами. Подсчитайте по каждой группе:
1. число предприятий
2. число рабочих
3. объем произведенной продукции за год
4. среднюю фактическую выработку одного рабочего
5. объем основных средств
6. средний размер основных средств одного предприятия
7. среднюю величину произведенной продукции одним предприятием
Результаты расчета оформите в таблицы. Сделайте выводы.
Решение
Для решения выберем наибольшее и наименьшее значения среднесписочного числа рабочих на предприятии. Это 43 и 256.
Найдем размер интервала: h = (256-43):6 = 35,5
Тогда в первую группу будут входить предприятия, среднесписочное число рабочих на которых составляет от 43 до 43+35,5=78,5 человек. Таких предприятий будет 5. Во вторую группу войдут предприятия, среднесписочное число рабочих на которых составит от 78,5 до 78,5+35,5=114 человек. Таких предприятий будет 12. Аналогично найдем число предприятий, входящих в третью, четвертую, пятую и шестую группы.
Полученный ряд распределения поместим в таблицу и вычислим необходимые показатели по каждой группе:
Вывод : Как видно из таблицы, вторая группа предприятий является самой многочисленной. В нее входят 12 предприятий. Самыми малочисленными являются пятая и шестая группы (по два предприятия). Это самые крупные предприятия (по числу рабочих).
Поскольку вторая группа самая многочисленная, объем произведенной продукции за год предприятиями этой группы и объем основных средств значительно выше других. Вместе с тем средняя фактическая выработка одного рабочего на предприятиях этой группы наибольшей не является. Здесь лидируют предприятия четвертой группы. На эту группу приходится и довольно большой объем основных средств.
В заключении отметим, что средний размер основных средств и средняя величина произведенной продукции одного предприятия прямо пропорциональны размерам предприятия (по числу рабочих).
Предмет математической статистики. Генеральная и выборочная совокупность.
Математическая статистика – раздел математики, который изучает способы отбора, группировки, систематизации и анализа статистических данных, для получения научно обоснованных выводов.
Статистические данные – числовые значения рассматриваемого признака изучаемых объектов, полученные как результат случайного эксперимента.
Математическая статистика тесно связана с теорией вероятностей, но в отличие от теории вероятностей, математическая модель эксперимента неизвестна. В математической статистике по статистическим данным необходимо установить неизвестное распределение вероятностей или объективно оценить параметры распределения.
Методы математической статистики позволяют строить оптимальные математические модели массовых, повторяющихся явлений. Связующим звеном между теорией вероятностей и математической статистикой являются предельные теоремы теории вероятностей.
В настоящее время статистические методы используются практически во всех отраслях народного хозяйства.
Генеральная совокупность – статистические данные всех изучаемых объектов (иногда – сами объекты). Часто генеральную совокупность рассматривают как СВ Х.
Выборка (выборочная совокупность) – статистические данные объектов, выбранных случайно из генеральной совокупности.
Объём выборки n (объём генеральной совокупности N ) – количество объектов, выбранных для изучения из генеральной совокупности (количество объектов в генеральной совокупности).
Примеры .
а) Статистическими данными могут быть: рост студентов; количество глаголов (или других частей речи) в отрывке текста определённой длины; средний балл аттестата; уровень интеллекта; число ошибок, допущенных диспетчером и т. п.
б) Генеральной совокупностью может быть: рост всех людей, разряды всех рабочих завода, частота употребления определённой части речи во всех произведениях изучаемого автора, средний балл аттестата всех выпускников и т. п.
в)Выборкой может быть: – рост 20 студентов, количество глаголов в выбранных произвольно 50 однородных отрывках текста длиной 500 словоупотреблений, средний балл аттестата 100 выпускников, выбранных случайно из школ города и т.п.
Выборка называется репрезентативной, если она верно отражает свойство генеральной совокупности. Репрезентативность выборки достигается случайностью отбора, когда все объекты генеральной совокупности имеют одинаковую вероятность быть отобранными.
Для того чтобы выборка была репрезентативной применяют различные способы отбора объектов изучения.
Виды отбора : простой, механический, серийный, типический.
Простой . Произвольно отбираются элементы из всей генеральной совокупности.
Механический отбор . Выбирают каждый 10 (25, 30 и т.п.) объект из генеральной совокупности.
Серийный . Проводится исследование в каждой серии (например, из текста выбирают 10 отрывков по 500 словоупотреблений- 10 серий).
Типический . Генеральную совокупность по определённому признаку разделяют на типические группы. Количество серий, извлекаемых из каждой такой группы, определяется удельным весом этой группы в генеральной совокупности.
Статистическое распределение выборки и его графическое изображение.
Пусть изучается СВ Х (генеральная совокупность) относительно некоторого признака. Проводится ряд независимых испытаний. В результате опытов СВ Х принимает некоторые значения. Совокупность полученных значений представляет собой выборку, а сами значения являются статистическими данными.
Первоначально проводят ранжирование выборки - расположение статистических данных выборки по неубыванию. Получаем вариационный ряд.
Вариационный ряд - проранжированная выборка.
Дискретный статистический ряд
Если генеральная совокупность является дискретной СВ, строится дискретный статистический ряд (статистическое распределение).
Пусть значение появилось в выборке раз,
Разa , …, - раз.
I-тая варианта выборки; - частота i-той варианты Частота показывает, сколько раз данная варианта появилась в выборке.
- относительная частота i-той варианты
(показывает какую часть выборки составляет ).
Статистическое распределение – это соответствие между вариантами выборки и их частотами или относительными частотами.
Для ДСВ статистическое распределение можно представить в виде таблицы – статистического ряда частот или статистического ряда относительных частот.
Статистический ряд частот Статистический ряд
относительных частот
| ........ | ||||
| ........ |
| ........ | ||||
| ........ |
Для наглядности представления статистического распределения выборки строят «графики» статистического распределения: полигон и гистограмму.
Полигон частот (относительных частот) – графическое изображение дискретного статистического ряда - ломаная линия, последовательно соединяющая точки [ для полигона относительных частот].
Пример. Исследователя интересуют знания абитуриентов по математике. Выбирают 10 абитуриентов и записывают их школьные оценки по этому предмету. Получена следующая выборка: 5;4;4;3;2;5;4;3;4;5.
а) Представить выборку в виде вариационного ряда;
б) построить статистический ряд частот и относительных частот;
в) изобразить полигон относительных частот для полученного ряда.
а) Проведем ранжирование выборки, т.е. расположим члены выборки по неубыванию. Получаем вариационный ряд: 2; 3; 3; 4; 4; 4; 4; 5; 5;5.
б) Построим статистический ряд частот (соответствие между вариантами выборки и их частотами) и статистический ряд относительных частот (соответствие между вариантами выборки и их относительными частотами)
| 0,1 | 0,2 | 0,4 | 0,3 |
Статистический ряд частот статистический ряд отн. частот
1+2+4+3=10=n 0,1+0,2+0,4+0,3=1.
Полигон относительных частот.