Ю.Н.Тюрин, А.А.Макаров СТАТИСТИЧЕСКИЙ АНАЛИЗ ДАННЫХ НА КОМПЬЮТЕРЕ Под редакцией В. Э. Фигурнова г^ сштшг V^l ИНФРА»М ББК 517.8, 32.973 Т98 УДК 519.2, 681.3 Тюрин Ю.Н., Макаров Д.А. -[-98 Статистический анализ данных на компьютере/Под ред. В.Э.Фигурнова — М.: ИНФРА-М, 1998. — 528 с., ил. ISBN 5-86225-662-8 Книга является учебным пособием по анализу данных и статистике, рассчитанным на прикладных специалистов, менеджеров и студентов. Излагаются основные сведения, необходимые на практике для анализа данных, на наглядных примерах рассматриваются основные постановки задач, а затем эти же примеры решаются с использованием популярных статистических пакетов STADIA, STATGRAPHICS, SPSS и Эвриста. В приложении дается обзор других программных средств для анализа дан- ных. Большое внимание в книге уделено средствам анализа временных рядов и других методам, часто используемым в прикладных задачах. ББК 517.8, 32.973 ISBN 5-86225-662-8 © Ю.Н.Тюрин, А.А.Макаров, 1997 Тюрин Юрий Николаевич Макаров Алексей Алексеевич Статистический анализ данных на компьютере Оригинал-макет подготовлен В.Э.Фигурновым с помощью Т^Х (егпТЕХ 3.1415 и dvips 5.54) Подписано в печать 21.10.97. Формат 60X90'/i6. Гарнитура «Антиква». Печать офсетная. Усл. п. л. 33. Тираж 11000 экз. Заказ 783. ЛР № 070824 от 21.01.1993г. Издательство «ИНФРА-М» 127247, Москва, Дмитровское шоссе, 107 Тел. (095)485-71-77, (095)485-76-18 — отдел сбыта, (095)485-70-63, (095)485-74-00 — заключение договоров. Факс (095)485-53-18. E-mail — contract@infrani.msk.ru Мелкооптовый склад — Скорняжный пер., д. 7, корп. 1, между ст. м. «Сухаревская» и «Красные ворота», за маг. «Военная книга», тел. (095)208-32-59 Отпечатано с готовых диапозитивов в ОАО «Ярославский полиграфкомбинат» 150049, г. Ярославль, ул. Свободы, 97. Об этой книге На протяжении более десятка лет авторы читали курсы лекций и проводили практические занятия по анализу данных и прикладной статистике в МГУ им. М.В.Ломоносова, в других учебных заведениях России и иных стран. Материалы наших лекций и опыт общения со слушателями и легли в основу этой книги. Нашими слушателями были самые разные люди: психологи и экономисты, бизнесмены и инжене- ры, медики, социологи и т.д. Мы стремились как можно более просто и понятно передать им дух статистической науки, научить их самым необходимым и употребительным методам обработки данных, т.е. спо- собам извлечения из них обоснованных выводов. Мы также стремились показать, как это делается с помощью персональных компьютеров и пакетов прикладных программ. В 1994 г. авторы написали книгу «Анализ данных на компьютере», которая была выпущена издательством «ИНФРА-М». Эта книга быстро разошлась среди читателей, а во многих вузах была положена в основу преподавания курсов статистики. Однако за время, прошедшее с мо- мента издания этой книги, заметно расширилось использование стати- стических методов анализа данных на практике, появилось много новых статистических компьютерных программ, а существующие программы значительно обновились. Поэтому, по многочисленным просьбам чита- телей, в книгу были включены главы, посвященные анализу временных рядов и описаны более новые версии статистических компьютерных программ, в том числе версии для Windows. Материал, помещенный в книгу, значительно увеличился, и мы даже решили дать книге новое название «Статистический анализ данных на компьютере». Это название, на наш взгляд, более точно отражает содержание книги. О роли прикладной статистики в современной жизни и о некоторых особенностях развития этой науки в нашей стране вы можете прочесть в предисловии редактора книги. А далее находится раздел «Как читать эту книгу», в котором описан порядок размещения материала в книге. Мы надеемся, что эта книга будет полезна всем, кто хочет осво- ить методы статистического анализа данных и применять их в своей деятельности. 3 Предисловие редактора Моторы реактивного самолета взревели еще прежде, чем все восемь пассажиров взошли на борт, и они не успели пристегнуть ремни, как самолет уже катил по полю... Вице-президент выступил первым. — Нас не удовлетворяют результаты этого месяца по Северо-Востоку. Цифры вам известны, как и мне. Я хочу знать, почему это происходит. И хочу, чтобы мне сказали, какие приняты меры. Самолет к этому времени уже поднялся в воздух. А.Хейли. «Колеса» — Законы статистики везде одинаковы, — продолжал Николай Петрович солидно. Утром, например, гостей бывает меньше, потому что публика еще исправна; но чем больше солнце поднимается к зениту, тем наплыв делается сильнее. И, наконец, ночью, по выходе из театров — это почти целая оргия! — И заметьте, — пояснил Семен Иванович, — каждый день, в одни и те же промежутки времени, цифры всегда одинаковые. Колебаний — никаких! Такова незыблемость законов статистики! М.Е.Салтыков-Щедрин. «За рубежом» В нашей повседневной жизни, бизнесе, иной профессиональной де- ятельности, а также в научных исследованиях мы постоянно сталкива- емся с событиями и явлениями с неопределенным исходом. Например, торговец не знает, сколько посетителей придет к нему в магазин, ра- бочий — Сколько времени ему придется сегодня добираться до работы, бизнесмен — какой будет завтра или через месяц курс доллара, бан- кир — вернут или нет взятый у него заем, страховщик — когда и какое ему придется выплачивать страховое вознаграждение и т.д. При этом нам постоянно приходится принимать в подобных неопределенных, связанных со многими случайностями ситуациях свои решения, иногда очень важные. В быту или в несложном бизнесе мы можем принимать такие решения на основе здравого смысла, интуиции, предыдущего опы- та. Здесь мы часто можем сделать некий «запас прочности» на действие случая: скажем, выходить из дома на десять минут раньше, чтобы уже почти наверняка не опаздывать на работу. Однако в более серьезном бизнесе, в условиях жесткой конкурен- ции, решения должны приниматься на основе тщательного анализа име- ющейся информации, быть обоснованными и доказуемыми. Например, вряд ли банк или совет директоров крупной корпорации примет решение 4 о вложении денег в некоторый проект только потому, что он кому-то «представляется выгодным». Здесь потребуется тщательный расчет, связанный с прогнозами состояния рынка и рентабельности вложений, оценками возможных рисков и их последствий и т.д. При этом уже вряд ли возможно делать большой запас прочности «на всякий случай», ибо тогда Вас опередят конкуренты, умеющие считать лучше и, тем самым, принимать более правильные решения. Для решения задач, связанных с анализом данных при наличии случайных и непредсказуемых воздействий, математиками и другими исследователями (биологами, психологами, экономистами и т.д.) за последние двести лет был выработан мощный и гибкий арсенал мето- дов, называемых в совокупности математической статистикой (а также прикладной статистикой или анализом данных). Эти методы позволяют выявлять закономерности на фоне случайностей, делать обоснованные выводы и прогнозы, давать оценки вероятностей их выполнения или невыполнения. Введению в эти методы и посвящена данная книга. Средства анализа данных на компьютерах. Широкому внедре- нию методов анализа данных в 60-х и 70-х годах нашего века немало способствовало появление компьютеров, а начиная с 80-х годов — пер- сональных компьютеров. Статистические программные пакеты сделали методы анализа данных более доступными и наглядными: теперь уже не требовалось вручную выполнять трудоемкие расчеты по сложным формулам, строить таблицы и графики — всю эту черновую работу взял на себя компьютер, а человеку осталась главным образом творческая работа: постановка задач, выбор методов их решения и интерпретация результатов. Результатом появления мощных и удобных пакетов для анализа данных на персональных компьютерах стало резкое расширение и из- менение круга потребителей методов анализа данных. Если раньше эти методы рассматривались главным образом как инструмент научных исследований, то начиная с середины 80-х годов основными покупате- лями статистических пакетов (которые продаются в сотнях тысяч ко- пий ежегодно) стали уже не научные, а коммерческие организации, а также правительственные и медицинские учреждения. Таким образом, методы анализа данных и статистические пакеты для компьютеров и других видов ЭВМ стали на Западе типичным и общеупотребительным инструментом плановых, аналитических, маркетинговых отделов про- изводственных и торговых корпораций, банков и страховых компаний, правительственных и медицинских учреждений. И даже представители мелкого бизнеса часто употребляют методы анализа данных либо само- стоятельно, либо обращаясь к услугам консультационных компаний. 5 Примеры. Приведем несколько примеров применения методов статистического анализа данных в практических задачах. 1. Рассмотрим достаточно простую, но часто встречающуюся задачу. Предположим, что Вы ввели важное нововведение: изменили систему оплаты труда, перешли на выпуск новой продукции, использовали новую технологию и т.п. Вам кажется, что это дало положительный эффект, но действительно ли это так? А может быть этот кажущийся эффект опре- делен вовсе не Вашим нововведением, а естественной случайностью, и уже завтра Вы можете получить прямо противоположенный, но столь же случайный эффект? Для решения этой задачи надо сформировать два набора чисел, каждый из которых содержит значения интересующего Вас показателя эффективности до и после нововведения. Статистиче- ские критерии сравнения двух выборок покажут Вам, случайны или неслучайны различия этих двух рядов чисел. 2. Другая важная за- дача — прогнозирование будущего поведения не- которого временного ря- да: изменения курса дол- лара, цен и спроса на продукцию или сырье и т.д. Для такого времен- ного ряда с помощью ста- тистического пакета про- грамм подбирают HeKOTO- Рис. 1. График изменения объема рое аналитическое урав- транспортных перевозок и его прогноз нение — строят регрессионную модель. Если мы предполагаем, что на интересующий нас показатель влияют некоторые другие факторы, их тоже можно включить в модель, предварительно (с помощью того же статистического пакета) проверив существенность (значимость) этого влияния. Затем на основе построенной модели можно сделать прогноз и указать его точность (см. рис. 1, а также гл. 11—14). 3. Во многих технологических процессах необходимо систематиче- ски контролировать состояние процесса, чтобы вовремя вмешаться при отклонениях его от нормального режима и предотвратить тем самым потери от выпуска некачественной продукции. Для этого использу- ются статистические методы контроля качества, повсеместное и не- укоснительное применение которых во многом определило поразитель- ные успехи японской промышленности. Здесь мы наблюдаем замеча- тельный пример внедрения статистических методов в широкую прак- тику. Японскими специ- алистами были отобраны наиболее простые прави- ла для оценивания дина- мики изменения качества продукции и его нагляд- ного представления. Эти правила выражены сами- ми простейшими слова- ми, и японские рабочие выучивают их наизусть, как молитву, после чего Рис. 2. Контрольная карта изменения показателя качества с зоной допустимых пределов изменения каждый простой рабочий знает, при каких обстоятельствах производ- ственный процесс в порядке, когда надо быть настороже, а когда срочно вызывать бригаду наладчиков (рис. 2). Рис. 3. С помощью кластерного анализа имеющаяся совокупность объектов разбита на три группы со схожими свойствами 4. Еще одна инте- ресная и часто встреча- ющаяся задача связана с классификацией объ- ектов. Пусть, напри- мер, Вы являетесь на- чальником кредитного от- дела банка. Столкнув- шись с невозвратом кре- дитов, Вы решаете впредь выдавать кредиты лишь фирмам, которые «схо- жи» с теми, которые се- бя хорошо зарекомендовали, и не выдавать тем, которые «схожи» с неплательщиками или мошенниками. Для классификации фирм можно собрать показатели их деятельности (например, размер основных фон- дов, валюту баланса, вид деятельности, объем реализации и т.д.), и провести кластерный анализ (в более сложных случаях — многомерное шкалирование, см. гл. 15) этих данных. Во многих случаях имеющи- еся объекты удается сгруппировать в несколько групп (кластеров), и Вы сможете увидеть, не принадлежит ли запрашивающая кредит фир- ма к группе неплательщиков (рис. 3). Аналогичный пример: пусть у Вас имеются данные о различных сортах пива, каждый из которых характеризуется множеством переменных: цвет, содержание алкоголя, других веществ, калорийность и т.п. Вы хотите закупать и продавать наиболее дешевое пиво, но близкое по совокупности свойств к очень престижному и дорогому сорту. С помощью тех же методов Вы сможете решить и эту задачу. Можно было бы привести еще множество других интересных при- меров применения методов анализа данных в самых разных областях: торговле и здравоохранении, образовании и управлении и т.д. Универсальные и специальные методы. Следует подчеркнуть, что методы статистического анализа являются универсальными и мо- гут применяться в самых разных областях человеческой деятельности. Скажем, предсказание курса доллара и прогноз спроса на автомобили делаются с помощью одних и тех же процедур. Поэтому требования неискушенных пользователей, чтобы им предоставили инструмент для анализа данных именно в банковском деле или именно в медицине, редко бывают обоснованными. Такой инструмент мог бы быть создан, если бы решаемые этими пользователями задачи были исключительно специфичны и не встречались ни в какой другой области. Как правило, это не так, и все нужные этим пользователям задачи могут быть реше- ны с помощью универсальных пакетов (подобно тому, как практически для всех пользователей нужные им средства подготовки документов обеспечиваются универсальными редакторами документов типа Word или WordPerfect). Разумеется, нет правил без исключений. Например, в Word или WordPerfect трудно на надлежащем уровне подготавливать документы с большим количеством формул (типа этой книги), и невозможно печатать ноты, поэтому в таких случаях используются специальные средства. Точно так же существуют и области человеческой деятельности, для которых требуются специфические статистические средства. Однако таких областей очень мало. По-видимому, наиболее важная из них — это страховые (актуарные) расчеты, используемые в своей деятельности страховыми компаниями. Методы визуализации данных. Чтобы решать, какие методы ана- лиза надо применить к имеющимся данным и насколько удовлетвори- тельны полученные результаты статистических процедур, нужно иметь возможность наглядно представлять себе эти данные и результаты. По- этому практически все статистические пакеты обеспечивают широкий набор средств визуализации данных: построение графиков, двух- и трех- мерных диаграмм, а часто и различные средства деловой графики. Все это помогает лучше представить обрабатываемые данные, получить об- щее представление об их особенностях и закономерностях. Результаты применения статистических процедур, как правило, представляются в наглядном графическом виде всегда, когда это возможно. О предварительной подготовке для анализа данных. Хотя ста- тистические пакеты для персональных компьютеров резко упростили применение методов статистического анализа данных, все же для осмы- сленного их употребления пользователи должны обладать определенной подготовкой: понимать, в каких ситуациях применимы различные стати- стические методы, знать, каковы их свойства, уметь интерпретировать результаты. На Западе такая подготовка обеспечивается обучением основам анализа данных практически всех студентов и менеджеров: в программы университетов, школ бизнеса, технических и других кол- леджей входят систематические курсы прикладной статистики. Раз- работаны и широко используются курсы основ теории вероятностей и статистики и для старших классов средней школы. В достатке имеется специальная и популярная литература по анализу данных, ее всегда можно найти в книжных магазинах, торгующих научно-технической литературой. А при затруднениях можно лично или по телефону обра- титься в одну из сотен консультационных фирм и получить там ква- лифицированную консультацию по постановкам задач, использованию статистических пакетов и т.д. К сожалению, в нашей стране ситуация совершенно другая. В сред- ней школе методы статистического анализа данных (хотя многие из них очень просты и весьма полезны) не упоминаются вовсе, а в высшей школе, даже в тех вузах и университетах, программы которых были просто перегружены математикой, методам анализа данных отводилось очень небольшое место. При этом обычно предметом изучения являются не столько эти методы, сколько формальные конструкции теории мно- жеств, теории меры, функционального анализа и теории вероятностей, которые, может быть, нужны для строгих доказательств, но абсолютно не способствуют освоению и бесполезны при применении этих методов. А в гуманитарных и медицинских вузах курсы анализа данных чаще все- го просто отсутствовали. В результате даже самые простейшие методы статистического анализа данных почти для всех отечественных руко- водителей и менеджеров остаются terra incognita1. Для исправления положения (что абсолютно необходимо для конкуренции с западным бизнесом), по-видимому, потребуется значительное время. Таким образом, российские специалисты и менеджеры, исследова- тели и студенты, желающие применять методы анализа данных, нахо- 1 Причины столь бедственного положения разнообразны, но одна из них вполне понятна. В стране, где важнейшие статистические данные, касающиеся экономики и сель- ского хозяйства, медицины и демографии, экологии и социологии тщательно скрывались с помощью режимов секретности, «форм доступа» и т.д. (даже от занимающихся этими вопросами специалистов), а зачастую и фальсифицировались, было вполне естественно сделать как можно менее распространенными и методы анализа данных. дятся в гораздо более затруднительном положении по сравнению со своими западными коллегами. Им приходится изучать многие аспек- ты прикладной статистики самостоятельно, при этом часто по книгам, рассчитанным не на прикладных специалистов, а на профессиональных математиков (просто потому, что в основном именно такие книги име- ются в наличии). Кроме того, при работе с западным статистическим пакетом им приходится читать объемистую и не всегда понятно напи- санную программную документацию на английском языке. Получить консультацию при затруднениях негде — разве что у своих же коллег. Ясно, что преодолеть эти препятствия далеко не всем под силу. Советы читателям. Что же можно посоветовать тем, кто собира- ется изучать методы анализа данных или применять в своей деятельно- сти? Вот некоторые рекомендации. 1. Читать популярные (рассчитанные на прикладных специалистов, а не профессиональных математиков) книги по анализу данных. Кроме данной книги, из книг на русском языке стоит отметить книги [68], [8], [14], [30], [85]. 2. Использовать (если нет очень веских причин поступать иначе) отечественные, а не западные статистические пакеты — они, как пра- вило, гораздо проще в использовании, снабжены понятной документа- цией и средствами интерпретации результатов. Особенно стоит поре- комендовать пакеты STADIA (универсальный статистический пакет) и ЭВРИСТА (специализированный пакет для анализа временных рядов и регрессионного анализа). 3. Для статистических пакетов с хорошей документацией — читать эту документацию. Очень часто она фактически является популярным учебником, наглядно и неформально объясняющим применение средств анализа данных, в том числе и самых мощных многомерных методов. Особенно в этой связи можно рекомендовать документации пакетов STADIA, ЭВРИСТА и SPSS. 4. Практически применять в ходе изучения анализа данных стати- стические пакеты. Очень часто это помогает понять назначение метода и его свойства лучше и быстрее, чем что-либо другое. Остается пожелать читателям этой (чрезвычайно, на мой взгляд, полезной и актуальной) книги успешно изучить изложенные в ней методы и научиться применять эти и другие методы анализа данных в своей практической деятельности. Виктор Фигурнов 10 Как читать эту книгу Структура книги. Материал, включенный в эту книгу, можно услов- но разбить на три части. Первую из них составляют главы с первой по четвертую, а также частично пятая и десятая главы. Здесь изло- жены основные понятия теоретической и прикладной статистики, владение которыми необходимо для осмысленного применения методов статистического анализа данных. Мы обсуждаем понятия случайной изменчивости, основные характеристики случайных величин, наиболее распространенные статистические распределения, а также основы про- верки статистических гипотез и оценивания параметров. Все изложение ведется не в строго формальном математическом ключе (который при- влекателен только для математиков), а на общепонятийном уровне, с привлечением многочисленных примеров. Вторая часть книги (главы 5—15) описывает статистические мо- дели, наиболее часто используемые на практике для анализа данных. Сюда вошли анализ нормальных выборок, регрессионный и факторный (или дисперсионный) анализ, исследование связи признаков и таблицы сопряженности, методы проверки согласия статистической модели с данными опыта, анализ временных рядов, а также краткий обзор дру- гих методов статистического анализа. При этом особое внимание мы уделили непараметрическим (свободным от распределения) методам, поскольку они имеют гораздо более широкие границы применимости (по сравнению с классическими гауссовскими), более устойчивы по от- ношению к отклонениям от моделей и лишь немного уступают в эффек- тивности наилучшим параметрическим методам, когда эти последние можно применять. Примерно треть книги (ее составляют последние параграфы каждой главы и три приложения) посвящена современным статистическим па- кетам и их использованию на персональных компьютерах. В этой части, во-первых, показано, как рассмотренные в книге задачи можно решать с помощью компьютера. В большей части книги для этого использу- ются популярные в России статистические пакеты: отечественный — STADIA и американский — STATGRAPHICS. А решение задач анализа временных рядов показывается с помощью отечественного пакета Эври- ста и американского пакета SPSS. Мы полагаем, что эти примеры будут полезны всем читателям, в том числе и пользователям других стати- 11 стических пакетов. Ведь входные данные и результаты статистической обработки, как правило, мало зависят от конкретного пакета, поскольку определяются общепринятыми традициями. В приложении 1 и 3 дан обзор состояния и основных характери- стик наиболее известных отечественных и зарубежных статистических пакетов и сведения о фирмах, их распространяющих. Примеры. Все обсуждаемые в книге постановки задач мы старались иллюстрировать на примерах. При этом на одном и том же примере мы показывали работу как непараметрических методов, так и их па- раметрических (гауссовских) аналогов. Это позволило нам провести наглядное сравнение различных методов с точки зрения их примени- мости, устойчивости и т.п. Кроме того, чтобы помочь читателю лучше понять алгоритмы обработки, мы разбирали применение статистических методов для одних и тех же данных как при ручных расчетах, так и при использовании компьютера. Данные для примеров взяты из из- вестных монографий А.Хальда [83], Р.Готсданкера [26], М.Холлендера и Д.А.Вулфа [91] и др., а также из практической работы авторов. Одной из особенностей этих примеров является сравнительно малый объем исходных данных. Это сделано не только из соображений облегче- ния демонстрации расчетов вручную. Другая причина состоит в том, что для большинства прикладных исследований, особенно в гуманитарных областях, характерны именно небольшие объемы данных (исключение здесь составляют, пожалуй, только демография и отдельные области медицинской статистики). А поскольку на подобных объемах выборок практически невозможна эффективная проверка гипотез об их распре- делении, а процедуры отбраковки грубых наблюдений бесполезны или малоэффективны, мы рассматривали в первую очередь непараметриче- ские статистические методы, т.е. методы, свободные от предположений о распределении и потому более универсальные. Порядок чтения книги. Читать эту книгу можно в различном по- рядке. Тем, кто только начинает знакомиться с теорией статистики, мы советуем прочитать сначала главы 1, 3 и 4. Они содержат базовые понятия прикладной статистики. К главе 2, содержащей сведения об основных вероятностных распределениях, можно обращаться по мере необходимости. Те, кто уже знаком с такими понятиями, как случай- ная величина, распределение вероятностей, статистические гипотезы и оценки, статистические критерии, уровни значимости, доверительные интервалы и т.п., могут начинать чтение с любой из интересующих их глав. Знакомство с работой типичных статистических процедур на персональном компьютере полезно начинать с приложений 1 и 2, где 12 описываются общая архитектура пакетов, их интерфейсы, возможности работы с данными и пр. Предварительные сведения. От читателя этой книги мы стара- лись не требовать особой математической подготовки — сведений из программы первого курса вуза более чем достаточно. Для использо- вания компьютерных разделов книги вполне достаточно знакомства с частями 3 и 7 книги В.Э.Фигурнова [81]. Обозначения. При записи чисел мы придерживались американской системы записи, т.е. целая часть от дробной отделяется не запятой, а точкой (скажем, два с половиной — это 2.5, а не 2,5). Дело в том, что именно такая форма записи чисел принята в статистических пакетах, а кроме того, при этом списки чисел, которые нам иногда приходится использовать в книге, становятся проще для восприятия. Числами в квадратных скобках обозначаются книги или статьи из списка литературы (так, [3] — ссылка на третью книгу в списке литературы). Сведения об авторах Тюрин Юрий Николаевич — д.ф.-м.н., профессор кафедры теории вероятностей механико-математического факультета МГУ им. М.В.Ломоносова. Много лет читал курсы теоретической и при- кладной статистики на различных факультетах МГУ, в других учеб- ных заведениях России и иных стран. Область научных интересов — многомерный непараметрический анализ, методы анализа нечисловой информации. Макаров Алексей Алексеевич — к.ф.-м.н., ведущий научный со- трудник НИИ Механики МГУ. Область научных интересов — непараме- трические методы анализа данных, статистические пакеты, прикладные задачи в бизнесе, маркетинге, экономике и т.д. Предложения и замечания по данной книге просьба посылать по адресу: 117899, Москва, Воробьевы горы, МГУ, УНИР ректората МГУ, Макарову А.А. 13 (Благодарности < ^^ В первую очередь, мы отдаем дань признательности и восхищения нашим учителям А.И.Колмогорову и Б.В.Гнеденко. Вместе с другими выдающимися учеными они были основателями школы математической статистики в СССР и учителями многих исследователей, внесших вклад в развитие отечественной статистики. Всех этих исследователей на- звать невозможно, так что мы отметим лишь некоторых. Становле- нию прикладной статистики много способствовали регулярные семина- ры и школы, организатором которых был С.А.Айвазян (тоже ученик А.П.Колмогорова). Выдающуюся роль в развитии в СССР планирования эксперимента сыграл В.В.Налимов (который в свое время был сотрудни- ком А.Н.Колмогорова). Кроме того, в распространении статистических знаний важную роль сыграли многочисленные полезные книги, как оте- чественные, так и переводные, выпущенные издательствами «Финансы и статистика», «Мир» и др. Всем им мы приносим свою глубокую благодарность. Мы глубоко признательны Д.С.Шмерлингу, явившимся инициато- ром и вдохновителем создания этой книги, за постоянное внимание и поддержку, которую он оказывал авторам. Мы благодарны нашему редактору В.Э.Фигурнову, который внес в текст много улучшений. Он также провел литературное и техническое редактирование, выполнил компьютерную верстку. Мы благодарны нашим рецензентам В.Н.Тутубалину и М.В.Болдину, а также многим другим нашим коллегам, внесшим ряд полезных замечаний и поправок. Мы выражаем глубокую признательность фирмам НПО «Инфор- матика и компьютеры», «ИнфоСтрой», «Центр Статистических Иссле- дований МГУ», «Статистические системы и сервис», «СтатДиалог», «ТАНДЕМ» за предоставленные для ознакомления последние версии пакетов: STADIA, STATGRAPHICS, ЭВРИСТА, SPSS, SYSTAT, МЕЗО- ЗАВР, Статистик-Консультант. Глава 1 Основные понятия прикладной статистики Цель этой главы — познакомить читателя с основными понятия- ми теории вероятностей и статистики, на которые опирается анализ данных изменчивой (случайной) природы. Не стремясь к строгому фор- мальному изложению, мы расскажем о случайных событиях и случай- ных величинах, об их характеристиках: распределении вероятностей, математическом ожидании, дисперсии и т.д. Будут введены наиболее распространенные понятия описательной статистики, используемые при обработке данных, такие как генеральная совокупность, выборка, вы- борочная функция распределения, медиана, квантили, гистограмма и др. В конце главы мы опишем, как можно вычислить соответствующие характеристики на компьютере. 1.1. Случайная изменчивость Статистика изучает числа, чтобы обнаружить в них закономерности. Все мы хорошо знакомы с закономерными явлениями и закономерными изменениями, они составляют главный объект научных исследований. Например, исследователя могут интересовать вопросы типа: как изме- няется давление в жидкости с изменением глубины? С какой скоростью движутся падающие тела? Как будет проходить химическая реакция, если мы определенным образом изменим температуру, давление и кон- центрации участвующих в реакции веществ и т.п. Знание законов природы позволяют нам ответить на подобные вопросы, не производя реальных опытов, т.е. заранее. Например, мы можем точно вычислить, какие вещества и в какой пропорции образуются при той или иной хими- ческой реакции, или предсказать, когда в данной местности произойдет следующее солнечное затмение. Но отнюдь не во всех ситуациях интересующий нас результат полно- стью и жестко определяется влияющими на него факторами. Например, мы не можем указать, сколько часов будет светить электрическая лам- почка или как долго будет служить телевизионный приемник. Невоз- можно предвидеть число посетителей магазина и количество товаров, которое они купят, каков будет результат бросания игральных костей и т.д. Ответы на подобные вопросы можно получить, только проведя 15 соответствующие испытания. Часто явления (ситуации), в которых ре- зультат полностью определяется влияющими на него факторами, назы- ваются детерминированными или закономерными, а те, в которых это не выполняется — недетерминированными или стохастическими. Идея случайности. Для описания явлений с неопределенным исходом (как в повседневной жизни, так и в науке) используется идея случайности. Согласно этой идее, результат явления с неопределенным исходом как бы определяется неким случайным испытанием, случайным экспериментом, случайным выбором. Иначе говоря, считается, что для выбора исхода в неопределенной ситуации природа словно бы бросает кости. Вопрос о том, насколько применим такой подход к явлениям окружающего мира, решается не путем его логического обоснования, а по результатам практического применения. Замечание. Вопросы о том, существует ли случайность «на самом де- ле», о происхождении случайного и соотношении закономерного и случайного являются дискуссионными философскими темами. Действительно, закономер- ные изменения, как подчеркивает само их название, порождены определенными причинами, которые могут быть названы, указаны и изучены. Отыскивая эти причины, мы исходим из убеждения, что если нечто изменилось, так это потому, что изменилось что-то другое, и это другое служит причиной первому. Когда же изменения происходят при полной неизменности условий, в которых протекает явление, мы объясняем это случайностью. Но поскольку полной неизменности условий на практике достичь невозможно, сохраняется логическая возможность отрицать наличие в природе случайности и объяснять неопределенность резуль- татов эксперимента воздействием неизвестных нам и неучтенных факторов. Мы не будем входить в эти философские споры и будем рассматривать проблемы случайности чисто технически, принимая этот подход лишь как модель для описания непредсказуемой изменчивости, дабы на его основе получать количе- ственные выводы и рекомендации для практики. Случайная изменчивость. Мы все хорошо знаем, что такое зако- номерность. Например, при формулировке законов природы мы гово- рим, что если одна величина принимает такое-то значение, то другая примет такое-то. Случайная изменчивость нам знакома в меньшей сте- пени, а потому о ней надо поговорить подробнее. Для начала лучше взять такой пример, где случайная изменчивость действует отдельно от закономерной, так сказать, «в чистом виде». Рассмотрим пример, заимствованный из книги А.Хальда. В таблице 1.1 приведены размеры головок 200 заклепок, изготовленных станком (который делает их тысячами). Все контролируемые условия, в которых работал станок, оставались неизменными. В то же время диаметры головок раз от разу несколько изменялись. Характерная черта слу- чайных колебаний — эти изменения выглядят бессистемными, хаотич- ными. Действительно, если бы в этих изменениях мы смогли обнару- 16 жить какую-либо закономерность, у нас появились бы основания, чтобы искать ответственную за эту закономерность причину, тем самым из- менчивость не была бы чисто случайной. Если бы, скажем, с течением времени размер головки заклепки проявил тенденцию к увеличению, мы могли бы попытаться связать это, например, с износом инструмента. Таблица 1.1 Диаметры 200 головок заклепок, мм 13.39 13.43 13.54 13.64 13.40 13.55 13.40 13.26 13.42 13.50 13.32 13.31 13.28 13.52 13.46 13.63 13.38 13.44 13.52 13.53 13.37 13.33 13.24 13.13 13.53 13.53 13.39 13.57 13.51 13.34 13.39 13.47 13.51 13.48 13.62 13.58 13.57 13.33 13.51 13.40 13.30 13.48 13.40 13.57 13.51 13.40 13.52 14.56 13.40 13.34 13.23 13.37 13.48 13.48 13.62 13.35 13.40 13.36 13.45 13.48 13.29 13.58 13.44 13.56 13.28 13.59 13.47 13.46 13.62 13.54 13.20 13.38 13.43 13.36 13.56 13.51 13.47 13.40 13.29 13.20 13.46 13.44 13.42 13.29 13.41 13.39 13.50 13.48 13.53 13.34 13.45 13.42 13.29 13.38 13.45 13.50 13.55 13.33 13.32 13.69 13.46 13.32 13.32 13.48 13.29 13.25 13.44 13.60 13.43 13.51 13.43 13.38 13.24 13.28 13.58 13.31 13.31 13.45 13.43 13.44 13.34 13.49 13.50 13.38 13.48 13.43 13.37 13.29 13.54 13.33 13.36 13.46 13.23 13.44 13.38 13.27 13.66 13.26 13.40 13.52 13.59 13.48 13.46 13.40 13.43 13.26 13:50 13.38 13.43 13.34 13.41 13.24 13.42 13.55 13.37 13.41 13.38 13.14 13.42 13.52 13.38 13.54 13.30 13.18 13.32 13.46 13.39 13.35 13.34 13.37 13.50 13.61 13.42 13.32 13.35 13.40 13.57 13.31 13.40 13.36 13.28 13.58 13.58 13.38 13.26 13.37 13.28 13.39 13.32 13.20 13.43 13.34 13.33 13.33 13.31 13.45 13.39 13.45 13.41 13.45 Обсуждение случайной изменчивости не обязательно начинать с такого специального примера. Каждому известны более простые опыты, в которых результат определяется случаем: раздача игральных карт или костей домино, бросание игральных костей, монет и т.д. У всех этих примеров есть общая черта — непредсказуемость результатов для действий, проводящихся в неизменных условиях. Закономерность и случайность. В большинстве явлений присут- ствуют оба вида изменчивости — и закономерная, и случайная, и для нахождения закономерностей нам приходится «отсеивать» мешающие случайные факторы. Например, при внесении удобрений на пшеничное поле мы не можем точно предсказать, какова будет урожайность на этом поле, поскольку она зависит от множества причин, которые мы считаем случайными (от погодных условий, нашествий вредителей, болезней растений и т.д.). Однако с помощью методов статистического анализа мы все же можем определить степень влияния на урожайность внесения удобрений и применения других агротехнических приемов. Для этого могут потребоваться многолетние тщательно спланированные экспери- менты, с помощью которых влияние агротехнических приемов оценива- ется на фоне мешающих факторов. 17 Итак, статистический подход к изучению явлений природы состоит в мысленном разделении наблюдаемой изменчивости на две части — обусловленные закономерными и случайными причинами, и выявлению закономерной изменчивости на фоне случайной. Например, в табл. 1.2 и на рис. 1.1 отображено изменение урожайности зерновых (в центнерах с гектара) в СССР за 45 лет, с 1945 по 1989 год. Данные предоставлены А.И.Манелля, которому авторы выражают глубокую признательность. Таблица 1.2 Урожайность зерновых культур в СССР с 1945 по 1989 гг. (в центнерах с гектара в первоначально оприходованном весе) Год Урожайность Год Урожайность Год Урожайность 1945 5.6 1960 10.9 1975 10.9 1946 4.6 1961 10.7 1976 17.5 1947 7.3 1962 10.9 1977 15.0 1948 6.7 1963 8.3 1978 18.5 1949 6.9 1964 11.4 1979 14.2 1950 7.9 1965 9.5 1980 14.9 1951 7.4 1966 13.7 1981 12.6 1952 8.6 1967 12.1 1982 15.2 1953 7.8 1968 14.0 1983 15.9 1954 7.7 1969 13.2 1984 14.4 1955 8.4 1970 15.6 1985 16.2 1956 9.9 1971 15.4 1986 18.0 1957 8.4 1972 14.0 1987 18.3 1958 11.1 1973 17.6 1988 17.0 1959 10.4 1974 15.4 1989 18.8 1940 19SB I960 197В 1980 1990 Рис. 1.1. Урожайность всех зерновых культур в СССР с 1945 по 1989 гг. (ц/га) Хорошо видно, что урожайность, в целом, возрастала (по-видимому, за счет улучшения агротехники и внесения минеральных удобрений). Ее рост и составляет закономерную часть картины. В то же время видны 18 и значительные колебания урожайности в разные годы, по-видимому, за счет погодных условий и иных факторов, изменения которых мы счи- таем случайными. Методы математической статистики позволяют в подобных ситуациях оценивать параметры имеющихся закономерно- стей, проверять те или иные гипотезы об этих закономерностях и т.д. В последующих главах этой книги мы рассмотрим, как решаются многие из подобных задач. Однако случайности могут не только мешать нам постигать законо- мерности — они способны и сами порождать их. Рассмотрим, например, газ в некотором сосуде (скажем, воздух в комнате). Поведение каждой молекулы газа носит случайный характер, но вся совокупность этих молекул ведет себя вполне закономерно, подчиняясь хорошо известным законам физики. Так, давление газа на каждую единицу площади по- верхности сосуда строго постоянно (колебания проявляются только для очень сильно разреженных газов), а объем газа, его давление и тем- пература связаны друг с другом уравнением Менделеева-Клапейрона. Аналогично, выбор времени для телефонных звонков каждый человек осуществляет сам, но нагрузка на телефонную станцию (АТС), распре- деление интервалов между звонками различных абонентов и т.д. под- чиняются вполне определенным закономерностям. Изучением законо- мерностей, которые порождаются случайными событиями, занимается наука теория вероятностей. 1.2. События и их вероятности Хотя результаты эксперимента (наблюдений, опыта), зависящего от случайных факторов, нельзя предсказать, все же разные возможные его исходы и связанные с ними события имеют неодинаковые шансы на появление. Количественное описание правдоподобия отдельных исхо- дов и событий основывается на понятии вероятности. Предполагается, что каждому событию, возможному в данном случайном испытании, может быть приписана числовая мера его правдоподобия, называемая его вероятностью. Если, скажем, А есть случайное событие, то его вероятность обычно обозначается через Р(А). (Буква Р — начальная в латинском слове «вероятность».) Вероятность невозможного события (которое никогда не происходит) принимается равной 0, а вероятность достоверного события (которое происходит всегда) принимается рав- ной 1. Поэтому для любого события А: 0 < Р(А) ^ 1. Свойства вероятности просты, естественны и, в общем, известны каждому. Однако перед тем, как рассказывать о них, необходимо дать некоторые определения, касающиеся случайных событий. 19 Случайные события. Объединением, или суммой событий А и В называют событие С, которое состоит в том, что происходит хотя бы одно из событий А и В. (С происходит тогда и только тогда, когда происходит либо А, либо В, либо оба вместе.) Обозначение: С= Ли В, или С=А+В. Пересечением, или произведением событий Л и В называют со- бытие С, которое состоит в том, что происходят оба события А я В. Обозначение: С = А П В, или С = АВ. Отрицанием события А называют такое событие, которое состоит в том, что А не происходит. Обозначение для него А. Событие, которое при нашем случайном испытании обязательно происходит, называют достоверным, которое не может произойти — невозможным. Вероятность достоверного события равна 1; вероятность невозможного события равна 0. Если события Л и В не могут произойти одновременно (т.е. если АВ — невозможное событие), их называют несовместимыми. Несо- вместимы, например, события Л и Л. В то же время Л + Л — событие достоверное. Например, при бросании игральной кости: • событие, состоящее в том, что в результате бросания кости выпадет 1, 2, 3, 4, 5 или 6 очков, является достоверным; • событие, состоящее в том, что результате бросания кости выпа- дет 7 очков, является невозможным; • объединением события Л, состоящего в том, что в результате бросания кости выпадет меньше 4 очков, и события В, состоя- щего в том, что в результате бросания кости выпадет 3 или 6 очков, будет событие Л + В, состоящее в том, что в результате бросания кости выпадет 1, 2, 3 или 6 очков; • пересечение АВ событий Л и В состоит в том, что в результате бросания кости выпадет 3 очка; • отрицание события Л, обозначаемое Л, состоит в том, что в результате бросания кости выпадет 4, 5 или 6 очков. Свойства вероятности. Теперь свойства вероятности перечислить просто: 1. О ^ Р(Л) $ 1 для любого события Л; 2. Р(Л + В) = Р(А) + Р(В), если события Л и В несовместимы, а в общем случае Р(Л + В) = Р(Л) + Р(-В) - Р(АВ); 20 3. Вероятность достоверного события равна 1, а невозможного события — нулю. Для полного описания случайного эксперимента нужно указать все его возможные исходы и их вероятности. Например, бросание играль- ной кости, имеющей форму куба, приводит к выпадению одной из ее шести граней. Это шесть элементарных исходов, т.е. неразложимых на более простые. Если кость, как говорят, правильная, то эти шесть исходов равноправны и поэтому должны иметь равные вероятности. Следовательно, вероятность каждого из них равна 1/6. Вероятности остальных (составных) событий может быть вычислена из приведенных выше свойств вероятности. Например, вероятность Р(В) события В, состоящего в том, что в результате бросания кости выпадет 3 или 6 очков, равна 1/3. Действительно, это событие является объединением двух несовместимых событий: «выпало 3 очка» и «выпало 6 очков», вероятность каждого из которых равна 1/6. Аналогично, вероятность Р(Л) события Л, состоящего в том, что в результате бросания кости выпадет меньше 4 очков, равна 1/2. Не будем далее развивать эту тему, оставив ее теории вероятно- стей. Но все же нам придется ввести еще два важных понятия — независимости событий и условной вероятности. Независимость событий. Определение 1. События А и В называются независимыми, если Р(ЛВ) = Р(Л).Р(В). На практике независимость событий обычно устанавливается не с помощью проверки этого равенства, а из условий опыта и других со- держательных соображений. При этом указанное соотношение можно использовать для вычисления вероятности событий АВ через вероятно- сти событий Л и В. Понятие независимости очень существенно для те- ории вероятностей. То, насколько в своей математической форме поня- тие независимости соответствует нашим интуитивным представлениям, лучше всего разобрать с помощью понятия условной вероятности. Условная вероятность. Для простоты мы рассмотрим, как можно определить понятие условной вероятности в случайном испытании с конечным числом исходов. Пусть П — совокупность всех таких ис- ходов, ш обозначает произвольный элементарный исход, Р{ш) — его вероятность. Любые события Л и В в этом опыте представляют собой некоторые подмножества Q, поскольку они. состоят из элементарных исходов. Обозначим через Р(Л [ В) условную вероятность события Л 21 при условии, что произошло событие В. Достаточно определить услов- ную вероятность для элементарных исходов ш. Те исходы ш, которые не входят в В, невозможны при наступлении события В, поэтому для них следует положить условную вероятность равной нулю: Р(ш \ В) = 0, если ш i В. Для исходов о>, входящих в В, сумма их вероятностей ^ga Р(ш) равна Р(-В), а сумма их условных вероятностей должна быть равна единице. Действительно, Ешев^!5) Р^"3 И8!-8)- н0 "Р" ^"У" пления В событие В является достоверным, поэтому согласно свойству 3 вероятностей Р{В \ В) равно 1. Чтобы это условие выполнялось, естественно положить для ш 6 В: Р{ш\В)=Р^)/Р(В). Теперь мы можем определить условную вероятность для любого события А. Определение. Условная вероятность события. А при условии В есть Р(Л|В)=^РНВ). шел Из этого определения легко вывести, что: Р(А\В)= Р(АВ) Р(В) • Это соотношение в общем случае (когда число элементарных ис- ходов не обязательно конечно) и принимают за определение условной вероятности. Из него легко следует известная формула умножения вероятностей: Р(АВ)=Р{А\В)Р(В). Заметим, что равноправие событий А» В позволяет написать также, что Р(АВ) = Р{В\А)Р(А). С помощью понятия условной вероятности мы можем дать другое определение независимости событий. Определение 2. Событие А не зависит от события В, если Р(А\В)=Р(А). Иначе говоря, событие А не зависит от события В, если вероятность события А не зависит от того, произошло или нет событие В. Нетрудно показать, что два определения независимости события А от В, данные выше, эквивалентны. Так же можно показать, что если А не зависит 22 от В, то и В не зависит от А. Единственная оговорка, которую надо добавить к сказанному, — что условную вероятность можно определять таким образом, лишь если Р{В) > 0. 1.3. Измерения вероятности Раз мы ввели понятие вероятности как количественное выражение для правдоподобия случайного события, нам необходим метод ее чи- сленного выражения. Здесь возможны два пути — умозрения и прямого измерения. Умозрительный способ определения численного значения вероятно- сти зиждется, в основном, на понятии равновозможности тех или иных исходов эксперимента. Мы уже прибегали к помощи этого соображения при обсуждении бросания игральной кости. Основная область прило- жения этого принципа — случайный выбор и азартные игры. Поэтому принцип равновозможности исходов эксперимента имеет ограниченное применение. Кроме того, выводы из этого принципа всегда относятся к некому идеальному случайному опыту, и то, насколько им подчиняется реальный эксперимент, само зачастую нуждается в проверке. Измерение вероятности события отличается от измерения других физических величин. Для массы, скорости, температуры и большинства других физических величин есть специальные приборы, позволяющие выразить их числом (что и означает измерить). К сожалению, для вероятности такого прибора нет. Все же прямое измерение вероятно- сти возможно, оно основано на независимых повторениях случайного эксперимента. Пусть в определенном случайном эксперименте нас интересует ве- роятность некоторого события А. Допустим, что мы можем многократно осуществлять этот эксперимент в неизменных условиях, так что от опы- та к опыту Р(А) не меняется. Проведем N таких повторений (иногда говорят — реализации) этого опыта. Число N не должно зависеть от исходов отдельных опытов; например, оно может быть назначено заранее. Подсчитаем число тех опытов из N, в которых событие А произошло. Обозначим это число через N(A). Рассмотрим отношение N{A)/N — частоту события А в N повторениях опыта. Оказывается, частота N(A)/N приблизительно равна Р{А), если число повто- рений N велико. Указанная связь между частотой события и его вероятностью соста- вляет содержание теоремы Бернулли, о которой подробнее мы будем го- ворить в главе 4. Там будет дана ее точная формулировка и доказатель- ство. Кроме того, важен и вопрос о достигаемой точности приближения 23 Литература 1. Айвазян С.А., Бухштабер В.М., Енюкое И.О., Мешалкин Л.Д. Приклад- ная статистика: Классификация и снижение размерности. Справочное издание под ред. Айвазяна С.А. — М.: Финансы и статистика, 1989. — 607 с. 2. Айвазян С.А., Енюкое И.С., Мешалкин Л.Д- Прикладная статистика: Основы моделирования и первичная обработка данных. Справочное издание под ред. Айвазяна С.А. — М.: Финансы и статистика, 1983. — 471 с. 3. Айвазян С.А., Енюкое И.С., Мешалкин Л.Д. Прикладная статистика: Исследование зависимостей. Справочное издание под ред. Айвазяна С.А. — М.: Финансы и статистика, 1985. — 471 с. 4. Андерсен Т. Введение в многомерный статистический анализ. — М.: Физматгиз, 1963. — 500 с. 5. Андерсен Т. Статистический анализ временных рядов. — М.: Мир, 1976. — 756 с. 6. Аптон Г. Анализ таблиц сопряженности. — М.: Финансы и статистика, 1982. — 144 с. 7. Арене X., Лейтер Ю. Многомерный дисперсионный анализ — М.: Фи- нансы и статистика, 1985. — 230 с. 8. Афифи А., Эйзен С. Статистический анализ. Подход с использованием ЭВМ. — М.: Мир, 1982. — 488 с. 9. Баласанов Ю.Г., Дойников А.Н., Королев М.Ф., Юровский А.Ю. При- кладной анализ временных рядов с программой ЭВРИСТА. Центр СП «Диалог» МГУ, 1991. — 328 с. 10. Бард И. Нелинейное оценивание параметров. — М.: Финансы и ста- тистика, 1979. — 349 с. 11. Бендат Дж., Пирсол А. Прикладной анализ случайных данных. — М.: Мир, 1989. — 540 с. 12. Бендат Дж., Пирсол А. Применение корреляционного и спектрального анализа. — М.: Мир, 1979. — 311 с. 13. Берну лли Я. О законе больших чисел. Под общей ред. Ю.В.Прохорова. — М.: Наука, 1986. — 176 с. 14. Бикел П., Доксум К. Математическая статистика. — М.: Финансы и статистика, 1983. Вып. 1 — 280 с.; Вып. 2 — 254 с. 15. БоксДж-.Дженкинс Г. Анализ временных рядов. Прогноз и управление. М.: Мир, 1974. Вып. 1 — 288 с.; Вып. 2 — 197 с. 16. Большее Л.Н., Смирнов Н.В. Таблицы математической статистики. — М.: Наука, 1983. — 416 с. 17. Боровков А.А. Теория вероятностей, 2-е изд., доп. — М.: Наука, 1986. — 431 с. 18. Бриллинждер Д. Временные ряды. — М.: Мир, 1980. — 536 с. 19. Векслер Л.С. Статистический анализ на персональном компьюте- ре//МИР ПК, № 2, 1992, с. 89-97. 514 20. Вучков И., Бояджиева Л., Солаков Е. Прикладной линейный регресси- онный анализ. — М.: Финансы и статистика, 1987. — 239 с. 21. Гаек Я.. Шидак 3. Теория ранговых критериев. — М.: Наука, 1971. — 376 с. 22. Гитис Э.И., Пискулов ЕЛ. Аналого-цифровые преобразователи. — М.: Энергоиздат, 1981. — 360 с. 23. Гнеденко Б.В. Курс теории вероятностей. — М.: Физматгиз, 1988. — 406 с. 24. Гоноровский И.С. Радиотехнические цепи и сигналы. — М.: Сов. Радио, 1977. — 608 с. 25. ГОСТ 23554.2-81. Система управления качеством продукции. Эксперт- ные методы оценки качества промышленной продукции. Обработка значений экспертных оценок качества продукции. — М.: Изд. Стандартов 1982. — 66 с. 26. Готтсданкер Р. Основы психологического эксперимента. — М.: МГУ, 1982. — 463 с. 27. Григорьев С.Г., Перфилов А.М., Левандовский В.В, Юнкеров В.И. Па- кет прикладных программ STATGRAPHICS на персональном компьютере (прак- тическое пособие по обработке результатов медико-биологических исследова- ний). С.-Петербург, 1992. — 104 с. 28. Демчденко Е.З. Линейная и нелинейная регрессия. — М.: Финансы и статистика, 1981. — 302 с. 1, 29. Дженкинс Г.. Ватте Д. Спектральный анализ и его приложения. — 'ч М.: Мир. Вып. 1, 1971. — 316 с.; Вып. 2, 1972. — 288 с. 30. Джонсон Н., Лион Ф. Статистика и планирование эксперимента в технике и науке. — М.: Мир. Т. 1, 1980, — 610 с., Т. 2, 1981, — 520 с. 31. Дрейпер Н., Смит Г. Прикладной регрессионный анализ: В 2-х книгах, Кн. 1. — М.: Финансы и статистика, 1986. — 366 с.. Кн. 2. — М.: Финансы и статистика, 1987. — 351 с. 32. Дэниел К. Применение статистики в промышленном эксперименте. — М.: Мир 1979. — 299 с. 33. Дюк В.А., Мирошников А.И. STATGRAPHICS Plus for Windows — учебное пособие по прикладной статистике//Тезисы доклада на международ- ной конференции «Статистическое образование в современном мире: идеи, ори- ентации, технологии», С.-Петербург, 1996 — с. 193 - 196 34. Дюк В.А., Мирошников А.И. Эволюция STATGRAPHICS//МИР ПК, № 12, 1995. 35. Енюкое И.С. Методы, алгоритмы, программы многомерного статистиче- ского анализа. — М.: Финансы и статистика, 1986. 36. Кендэлл М., Стьюарт А. Статистические выводы и связи. — М.: Наука, 1973. — 899 с. 37. Кендэлл М., Стьюарт А. Теория распределений. — М.: Наука, 1966. 38. Кендэлл М., Стюарт А. Многомерный статистический анализ и вре- менные ряды. — М.: Наука, 1976. — 736 с. 39. Кендэлл М. Временные ряды. — М.: Финансы и статистика, 1981. — 199 с. 40. Кендэлл М. Ранговые корреляции. — М.: Статистика, 1975. — 212 с. 41. Кокрен У. Методы выборочного исследования. — М.: Статистика, 1976. — 440 с. 515 42. КоксД.Р-.Оукс Д. Анализ данных типа времени жизни. —М.: Финансы и статистика, 1988. — 192 с. 43. Колмогоров А.Н. Об одном новом подтверждении законов Менде- ЛЯ//ДАН СССР, 1940, т. 27, № 1, стр. 38-42. 44. Крамер Г. Математические методы статистики. — М.: Мир, 1975. — 648 с. 45. Крылов В.Ю. Геометрическое представление данных в психологических исследованиях. — М.: Наука, 1990. — 117 с. 46. Кулаичев АЛ. Пакеты для анализа данных//МИР ПК, № 1, 1995. 47. Левин Б.Р. Теоретические основы статистической радиотехники. В трех кн. — М.: Сов. Радио, 1975. 48. Леман Э. Проверка статистических гипотез. — М.: Наука, 1964. — 498 с. 49. Леман Э. Теория точечного оценивания. — М.: Наука, 1991. — 448 с. 50. Ликеш И., Ляга И. Основные таблицы математической статистики. — М.: Финансы и статистика, 1985. — 356 с. 51. Литтл Р.Длс., Рубин Д.Б. Статистический анализ данных с пропуска- ми. — М.: Финансы и статистика, 1991. — 336 с. 52. Лукашин Ю.П. Адаптивные методы краткосрочного прогнозирова- ния. — М.: Статистика, 1979. — 254 с. 53. Макаров АЛ. STADIA против STATGRAPHICS, или кто ваш «лоцман» в море статистических данных//МИР ПК, № 3, 1992, с. 58—66. 54. Макаров А.А. Роль и место статистических пакетов программ в курсах математической и прикладной статистики//Тезисы доклада на международной конференции «Информационные технологии в непрерывном образовании». Пе- трозаводск, 1995. — с. 127—128. 55. Макаров А.А. Статистические пакеты в обучении математической и при- кладной статистике//Тезисы доклада на международной конференции «Стати- стическое образование в современном мире: идеи, ориентации, технологии». С.-Петербург, 1996. — с. 193—196. 56. Макано Т., Охаси М., Доке X., Макино К. Контроль качества с помощью персональных компьютеров. — М.: Машиностроение, 1991. 57. Мардиа К., Земроч П. Таблицы F-распределений. — М.: Наука, 1984. — 255 с. 58. Марпл-мл. С.Л. Цифровой спектральный анализ и его приложения. — М.: Мир, 1990. — 584 с. 59. Мэйндоналд Дж. Вычислительные алгоритмы в прикладной статисти- ке. — М.: Финансы и статистика, 1988. — 350 с. 60. Мюллер П., Пойман П.. Шторм Р. Таблицы по математической стати- стике. — М.: Финансы и статистика, 1982.— 278 с. 61. Оуэн Д.Б. Сборник статистических таблиц. Изд. 2-е, испр. — М.: ВЦ АН СССР, 1973. — 586 с. 62. Поллард Дж. Справочник по вычислительным методам статистики. — М.: Финансы и статистика, 1982. — 344 с. 63. Рао С.Р. Линейные статистические методы и их применение. — М.: Наука, 1968. — 548 с. 64. Рунион Р. Справочник по непараметрической статистике. Современный подход. — М.: Финансы и статистика, 1982. — 198 с. 516 65. Семенов НА. Программы регрессионного анализа и прогнозирования временных рядов. Пакеты ПАРИС и МАВР. — М.: Финансы и статистика 1990. — 111 с. 66. Смирнов Н.В., Дунин-Барковский И.В. Курс теории вероятностей и математической статистики для технических приложений. Изд. 2-е, испр и доп. — М.: Наука, 1965. — 511 с. 67. Смоляк С.А., Титаренко Б.П. Устойчивые методы оценивания. — М.: Статистика, 1980. — 206 с. 68. Справочник по прикладной статистике. В 2-х т., под ред. Э.Ллойда, У.Ледермана, Ю.Н.Тюрина — М.: Финансы и статистика, 1989, 1990. 69. Справочник по специальным функциям с формулами, графиками и таблицами/Под ред. М.А.Абрамовица, И.Стиган. — М.: Наука, 1979. — 830 с. 70. Статистические методы для ЭВМ/Под ред. К.Эйнслейна, Э.Рэлстона Г.С.Уолфа — М.: Наука, 1986. — 459 с. 71. Статистические методы повышения качества/Под ред. Хитоси Куме. — М.: Финансы и статистика, 1991. 72. Стреляу Я. Роль темперамента в психическом развитии. — М • Про- гресс, 1982. — 231 с. 73. Теннант-Смит Дж. Бейсик для статистиков. — М.: Мир, 1988 — 207 с. 74. Тутубалин В.Н. Границы применимости (вероятностно-статистические методы и их возможности). — М.: Знание, 1977. — 61 с. Н / 75. Тутубалин В.Н. Теория вероятностей и случайных процессов — М • " Изд-во МГУ, 1992. — 400 с. V 76. Тьюки Дж. Анализ результатов наблюдений. Разведочный анализ — М.: Мир, 1981. — 693 с. 77. Тюрин Ю.Н.. Симонова Г.И. Знаковый анализ линейных моделей //Обозрение прикладной и промышленной математики, т 1 вып 2 1994 — с. 214—278. 78. Урбах В.Ю. Математическая статистика для биологов и медиков — М.: Изд-во АН СССР, 1963. — 323 с. 79. Факторный, дискриминантный и кластерный анализ. — М.: Финансы и статистика, 1989. — 215 с. 80. Феллер В. Введение в теорию вероятностей и ее приложения. — М • Мир. Т. 1, 1964, — 498 с., Т. 2, 1967, — 752 с. 81. Фигурнов В.Э. IBM PC для пользователя. Краткий курс. — М.: Инфра- М, 1997. — 480 с. 82. Флейс Дж. Статистические методы для изучения таблиц долей и про- порций. — М.: Финансы и статистика, 1989. — 319 с. 83. ХальдА. Математическая статистика с техническими приложениями. — М.: Изд-во Иностранной литературы, 1956. — 664 с. 84. Хампель Ф., Рончетти Э., Рауссей П., Штаэль В. Робастность в статистике. Подход на основе функций влияния. — М.: Мир, 1989. — 512 с. 85. Хан Г., Шапиро С. Статистические модели в инженерных задачах. — М.: Статистика, 1980. — 444 с. 86. Хартман Г. Современный факторный анализ. — М.: Статистика, 1972. 87. Хастингс Н., Пикок Дж. Справочник по статистическим распределе- ниям. М., Статистика, 1980. — 95 с. 517 88. Хенинен А.Я., Павлов Ю.Л. Статистик-Консультант, или Еще один довод в пользу неизбежного//МИР ПК, № 6, 1994. 89. Хеттсманпергер Т. Статистические выводы, основанные на рангах. — М.: Финансы и статистика, 1987. — 334 с. 90. Хикс Ч. Основные принципы планирования эксперимента. — М.: Мир, 1967. — 406 с. 91. Холлендер М., Вулф Д. Непараметрические методы статистики. — М.: Финансы и статистика, 1983. — 518 с. 92. Хьюбер П. Робастность в статистике. — М.: Мир, 1984. — 304 с. 93. Шиндовский Э., Шюрц О. Статистические методы контроля производ- ства. М. Госкомстандарт, 1969. — 542 с. 94. Ширяев А.Н. Вероятность. — М.: Наука, 1980. — 574 с. 95. Шуриков В.В., Дайитбегов ДМ., Мизрохи С.В., Ясеновский С.В. Автоматизированное рабочее место для статистической обработки данных — М.: Финансы и статистика, 1990. — 190 с. 96. Яглом А.М. Корреляционная теория стационарных случайных функций (с примерами из метеорологии). — Гидрометеоиздат, 1981. — 280 с. 97. Box G.E.P., Cox D.R. An analysis of transformations, J. Roy. Stat. Soc., 1964, В 26, р. 211-243 98. Chatfield C. The Analysis of Time Series: an Introduction, 4th ed. — Chapmam and Hall, 1989. — 242 p. 99. Elliott A.C., Gray Y.L. Directory of Statistical Microcomputer Software. — N.Y.: Basel, 1986. 100. Event В. A Handbook of Statistical Analyses using S-PLUS. Chapman & Hall, 1994. — 143 p. 101. Granger C.W.J., Newbold P. Forecasting Economic Time Series, 2nd ed. — Academic Press, Inc., 1986. — 338 p. 102. Hartley H.O. Testing of homogeneity of a set of variances. — Biometrika, 1940, 31, pp. 249-255. 103. Mosteller F., Tukey J.W. Data Analysis and Regression: A Second Course in Statistics. Reading, MA: Addison-Wesley, 1977. 104. Neter J., Wasserman W., Whitmore G.A. Applied Statistics, Allyn and- Bacon, Inc., 1988. — 1006 p. 105. Sen Р.К. Nonparametric simultaneous inference for some MANOVA models/Handbook of Statistics. — v.l. Holland, 1980. 106. Software Digest Rating Report. 1991, v. 8, № 5. 107. Spector P. An introduction to S and S-PLUS. Duxbury Press, 1994. — 286 p. 108. Venables M.N., Ripley B.D. Modern Applied Statistics with S-PLUS. Springer-Verlag, 1994 — 462 p. 109. Woodwant W.A. Elliott A.C., Gray Y.L., Mattlock D.C. Directory of Statistical Microcomputer Software. — N.Y.: Basel, 1988. Краткий путеводитель по списку литературы Для удобства читателей мы помещаем краткие пояснения к списку ли- тературы. Справочники по прикладной статистике — [68], [62]. 518 Стандартные учебники теории вероятностей и статистики — (строгий, аксиоматический подход) — [23], [17], [94], [44]. Учебники и пособия по статистике, рассчитанные на прикладных специали- стов - [14], [66], [30], [68], [85], [8], [2], [3], [I]. Вероятностные распределения — [16], [37], [50], [68], [87]. Таблицы распределений — [16], [50], [60], [61], [69]. Случайный выбор — [41]. Непараметрические методы статистики — [91], [64], [89], [21]. Компьютерные алгоритмы статистики — [59], [8], [73], [70]. Разведочный анализ данных — [76]. Анализ данных с пропусками — [51]. Регрессионный анализ — [31], [28], [20], [92], [103]. Дисперсионный анализ — [31], [32], [30], [90], [I]. Планирование эксперимента — [30], [90], [32]. Таблицы сопряженности — [б], [82], [36]. Меры связи признаков — [40], [64], [78]. Анализ временных рядов — [l2], [15], [18], [29], [39], [68], [38], [96], [9], [101], [98], [5]. Многомерные методы — [4], [68], [79], [35], [38], [1]. Факторный анализ — [8], [79], [86], [38], [I]. Дискриминантный анализ — [8], [79], [I]. Кластерный анализ — [35], [68], [79], [I]. Многомерное шкалирование — [45], [68], [70]. Методы контроля качества — [56], [71]. Замечания. Из книг, приведенных в списке литературы, выделим двух- томный «Справочник по прикладной статистике» [68], написанный, в основном, английскими учеными. Он отражает добротный уровень английской статисти- ческой науки (и некоторые ее особенности). Этот справочник содержит поста- новки основных задач анализа данных и сведения о методах их решения. Кроме того, мы хотели бы отметить трехтомник «Прикладная статистика» С.А.Айвазяна и его соавторов В.М.Бухштабера, И.С.Енюкова, Л.Д.Мешалкина [2], [3], [I]. Это справочное издание вобрало в себя многолетний опыт работы как его авторов, так и всей школы прикладной статистики в СССР. Издание отражает широкий круг статистических приложений, причем в единстве основ- ных проблем прикладной статистики: построения статистической модели, раз- вития математической теории, проведения численных расчетов. Библиография трехтомника содержит множество ссылок на книги и статьи на русском языке. Из книг, носящих обзорный, справочный характер в конкретных областях прикладной статистики, обратим внимание на следующие: в области вероятност- ных распределений — [16], [87]; в области регрессионного и дисперсионного анализа — [31]; в области непараметрических методов — [91]. Те, кого инте- ресуют вопросы разработки компьютерных алгоритмов статистики, могут найти полезную информацию в [59], [73]. Более строгое аксиоматическое изложение основ теории вероятностей и статистики содержится в [23], [17], [94], [44], [14]. Оглавление Об этой книге.....................................................3 Предисловие редактора........................................ 4 Как читать эту книгу........................................... 11 Благодарности.................................................. 14 Глава 1. Основные понятия прикладной статистики..... 15 1.1. Случайная изменчивость.................................... 15 1.2. События и их вероятности .................................. 19 1.3. Измерения вероятности..................................... 23 1.4. Случайные величины. Функции распределения..............24 1.5. Числовые характеристики распределения вероятностей................................................ 29 1.6. Независимые и зависимые случайные величины ............ 34 1.7. Случайный выбор........................................... 36 1.8. Выборки и их описание..................................... 38 1.8.1. Что такое выборка ....................................... 38 1.8.2. Выборочные характеристики.............................. 39 1.8.3. Ранги и ранжирование ................................... 42 1.8.4. Методы описательной статистики ......................... 44 1.8.5. Наглядные методы описательной статистики................46 1.9. Методы описательной статистики в пакетах STADIA и STATGRAPHICS .......................................... 49 1.9.1. Пакет STADIA...........................................49 1.9.2. Пакет STATGRAPHICS.................................. .55 Глава 2. Важные законы распределения вероятностей................................................ 64 2.1. Биномиальное распределение............................... 65 2.2. Распределение Пуассона.................................... 68 2.3. Показательное распределение ...............................71 2.4. Нормальное распределение ................................. 73 522 2.5. Двумерное нормальное распределение ...................... 76 2.6. Распределения, связанные с нормальным ................... 78 2.6.1. Распределение хи-квадрат ................................ 79 2.6.2. Распределение Стьюдента ................................ 80 2.6.3. F-распределение......................................... 81 2.7. Законы распределения вероятностей в пакетах STADIA и STATGRAPHICS..............;.................. .82 2.7.1. Пакет STADIA.......................................... .82 2.7.2. Пакет STATGRAPHICS.................................. .85 Глава 3. Основы проверки статистических гипотез...... 92 3.1. Статистические модели..................................... 92 3.2. Проверка статистических гипотез (общие положения)...... 95 3.3. Примеры статистических моделей и гипотез............... 101 3.4. Проверка статистических гипотез (прикладные задачи)..................................................... 106 3.4.1. Схема испытаний Бернулли.............................. 106 3.4.2. Критерий знаков для одной выборки ......................110 3.5. Проверка гипотез в двухвыборочных задачах .............. 111 3.5.1. Критерий Манна-Уитни................................. 113 3.5.2. Критерий Уилкоксона...................................117 3.6. Парные наблюдения ....................................... 123 3.6.1. Критерий знаков для анализа парных повторных наблюдений.............................................. 124 3.6.2. Анализ повторных парных наблюдений с помощью знаковых рангов (критерий знаковых ранговых сумм Уилкоксона)............................................. 126 3.7. Проверка статистических гипотез в пакетах STADIA и STATGRAPHICS ......................................... 128 3.7.1. Пакет STADIA.......................................... 128 3.7.2. Пакет STATGRAPHICS.................................. 132 Глава 4. Начала теории оценивания ...................... 140 4.1. Введение .................................................. 140 4.2. Закон больших чисел ...................................... 141 4.3. Статистические параметры ................................ 146 4.3.1. Параметры распределения ............................... 146 4.3.2. Параметры модели...................................... 147 4.4. Оценивание параметров распределения по .выборке........ 148 4.5. Свойства оценок. Доверительное оценивание .............. 151 4.6. Метод наибольшего правдоподобия........................ 153 523 4.7. Оценивание параметров вероятностных распределений в пакетах STADIA и STATGRAPHICS....... 156 4.7.1. Пакет STADIA.......................................... 157 4.7.2. Пакет STATGRAPHICS.................................. 161 Глава 5. Анализ одной и двух нормальных выборок... 165 5.1. Об исследовании нормальных выборок..................... 165 5.2. Глазомерный метод проверки нормальности................ 167 5.3. Оценки параметров нормального распределения и их свойства .............................................. 169 5.4. Проверка гипотез, связанных с параметрами нормального распределения................................ 174 5.4.1. Одна выборка .......................................... 174 5.4.2. Две выборки ........................................... 176 5.4.3. Парные данные......................................... 178 5.5. Анализ нормальных выборок в пакетах STADIA и STATGRAPHICS......................................... 181 5.5.1. Пакет STADIA.......................................... 182 5.5.2. Пакет STATGRAPHICS.................................. 184 Глава 6. Однофакторный анализ........................... 191 6.1. Постановка задачи .........................................191 6.2. Непараметрические критерии проверки однородности ..... 195 6.2.1. Критерий Краскела-Уоллиса (произвольные альтернативы)............................................ 196 6.2.2. Критерий Джонкхиера (альтернативы с упорядочением)........................... 197 6.3. Практический пример ..................................... 198 6.4. Оценивание эффектов обработки (непараметрический подход).................................................... 201 6.5. Дисперсионный анализ .................................... 204 6.6. Оценивание эффектов обработки в нормальной модели.... 206 6.6.1.Доверительные интервалы............................... 206 6.6.2. Метод Шеффе множественных сравнений................. 207 6.7. Однофакторный анализ в пакетах STADIA и STATGRAPHICS......................................... 209 6.7.1. Пакет STADIA..........................................209 6.7.2. Пакет STATGRAPHICS..................................214 Глава 7. Двухфакторный анализ........................... 224 7.1. Связь задач двухфакторного и однофакторного анализа.... 224 524 7.2. Таблица двухфакторного анализа .......................... 225 7.3. Аддитивная модель данных двухфакторного эксперимента при независимом действии факторов......... 226 7.4. Непараметрические критерии проверки гипотезы об отсутствии эффектов обработки......................... 227 7.4.1. Критерий Фридмана (произвольные альтернативы)......... 227 7.4.2. Критерий Пейджа (альтернативы с упорядочением)........ 229 7.5. Практический пример ..................................... 230 7.6. Двухфакторный дисперсионный анализ.................... 232 7.7. Двухфакторный анализ в пакетах STADIA и STATGRAPHICS......................................... 235 7.7.1. Пакет STADIA..........................................235 7.7.2. Пакет STATGRAPHICS..................................238 Глава 8. Линейный регрессионный анализ.............. 245 8.1. Модель линейного регрессионного анализа ................ 245 8.2. О стратегии, методах и проблемах регрессионного анализа .................................................... 247 8.3. Простая линейная регрессия............................... 250 8.4. О проверке предпосылок в задаче регрессионного анализа .................................................... 254 8.5. Непараметрическая линейная регрессия................... 256 8.6. Практический пример......................................262 8.7. Регрессионный анализ в пакетах STATGRAPHICS и STADIA.................................................. 267 8.7.1. Пакет STATGRAPHICS..................................267 8.7.2. Пакет STADIA..........................................279 Глава 9. Независимость признаков....................... .285 9.1.0 шкалах измерений....................................... 285 9.2. Инструменты и стратегия исследования связи признаков.................................................. 288 9.3. Связь номинальных признаков (таблицы сопряженности)............................................ 289 9.4. Связь признаков, измеренных в шкале порядков........... 298 9.5. Связь признаков в количественных шкалах................ 302 9.5.1. Коэффициент корреляции................................ 302 9.5.2. Нормальная корреляция................................. 305 9.6. Замечания о связи признаков, измеренных в разных шкалах..................................................... 308 525 9.7. Анализ таблиц сопряженности и коэффициенты корреляции в пакетах STADIA и STATGRAPHICS.......... 308 9.7.1. Пакет STADIA..........................................308 9.7.2. Пакет STATGRAPHICS..................................312 Глава 10. Критерии согласия................................ 317 10.1. Введение................................................. 317 10.2. Критерии согласия Колмогорова и омега-квадрат в случае простой гипотезы ................................. 318 10.3. Практический пример (закон Менделя)................... 322 10.4. Критерий согласия хи-квадрат К-Пирсона для простой гипотезы .......................................... 324 10.5. Критерии согласия для сложной гипотезы ................ 326 10.6. Критерий согласия хи-квадрат Фишера для сложной гипотезы................................................... 329 10.7. Другие критерии согласия. Критерий согласия для Пуассоновского распределения............................. 332 10.8. Критерии согласия в пакетах STADIA и STATQRAPHICS......................................... 336 10.8.1. Пакет STADIA.........................................336 10.8.2. Пакет STATGRAPHICS.................................341 Глава 11. Временные ряды: теоретические основы ..... 346 11.1. Введение................................................. 346 11.2. Анализ временных рядов и его разделы................... 348 11.3. Цели, этапы и методы анализа временных рядов.......... 350 11.4. Детерминированная и случайная составляющие временного ряда............................................351 11.5. Тренд, сезонная и циклическая компоненты .............. 354 11.6. Модели тренда ........................................... 357 11.7. Модели случайной компоненты........................... 359 11.8. Числовые характеристики временных рядов .............. 364 11.9. Процессы, стационарные в широком смысле.............. 366 11.10. Оценки числовых характеристик временных рядов ...... 368 Глава 12. Временные ряды: практический анализ...... 375 12.1. Порядок анализа временных рядов........................375 12.2. Графические методы анализа временных рядов ........... 376 12.3. Методы сведения к стационарности ...................... 379 12.3.1. Выделение тренда ..................................... 379 12.3.2. Выделение сезонных эффектов.......................... 385 526 12.3.3. Метод скользящих средних ............................. 392 12.3.4. Сезонные разностные операторы ........................ 397 12.3.5. Преобразование шкалы................................. 398 12.4. Методы исследования структуры стационарного временного ряда............................................402 12.4.1. Цели и методы анализа.................................402 12.4.2. Интерпретация графика коррелограммы.................. 403 12.4.3. Интерпретация графика частной автокорреляционной функции.............................. 408 Глава 13. Анализ временных рядов на компьютере ..... 411 13.1. О выборе пакетов для описания в этой книге ............. 411 13.2. Анализ временных рядов в SPSS ......................... 411 13.2.1. Обзор возможностей................................... 412 13.2.2. Подбор тренда и прогнозирование ....................... 413 13.2.3. Устранение сезонной компоненты ....................... 422 13.3. Анализ временных рядов в пакете ЭВРИСТА............. 425 13.3.1. Общие сведения о пакете............................... 425 13.3.2. Подбор тренда и прогнозирование ....................... 427 13.2.3. Устранение сезонной компоненты ....................... 434 13.2.4. Подбор модели авторегрессии и построение прогноза..... .437 Глава 14. Линейные модели временных рядов.......... 443 14.1. Авторегрессия первого порядка AR(1).................... 443 14.2. Авторегрессия второго порядка AR(2).................... 445 14.3. Авторегрессия порядка р — AR(p)........................450 14.4. Процессы скользящего среднего MA(q)................... 453 14.5. Комбинированные процессы авторегрессии-скользящего среднего ARMA(p, q)...........457 14.6. Линейные модели и операторы сдвига .................... 458 Глава 15. Многомерный анализ и другие статистические методы................................... 461 15.1. Введение................................................. 461 15.2. Многомерный статистический анализ.....................461 15.3. Факторный анализ........................................ 463 15.4. Дискриминантный анализ ................................ 464 15.5. Кластерный анализ ....................................... 464 15.6. Многомерное шкалирование.............................. 465 15.7. Методы контроля качества ............................... 466 15.8. Использование статистических пакетов................... 467 527 Приложение 1. Средства анализа данных на персональных компьютерах ........................ 468 П1.1. Введение................................................. 468 П1.2. Виды статистических пакетов............................ 469 П1.3. Возможности табличных процессоров и баз данных...... 470 П1.4. Требования к статистическим пакетам общего назначения......................................... 471 П1.5. Состояние и особенности российского рынка............. 472 П1.6. Статистические пакеты в среде Windows................. 479 П1.7. Документация статистических пакетов................... 482 П1.8. Встроенный справочник и экспертная поддержка ........ 484 П1.9. Делая выбор............................................. 487 Приложение 2. Возможности пакетов STADIA и STATGRAPHICS.........:............................... 489 П2.1. Введение.................................................489 П2.2. О пакетах STADIA и STATQRAPHICS ................... 489 П2.3. Статистические методы.................................. 490 П2.4. Архитектура пакетов..................................... 492 П2.5. Интерфейсы пользователя ............................... 494 П2.6. Работа с данными........................................ 496 П2.7. Графические возможности ............................... 501 П2.8. Подготовка отчетов ...................................... 504 П2.9. Документация........................................... .504 П2.10. Справочник и экспертная поддержка.................... 505 П2.11. Технические характеристики............................ 506 П2.12. Ошибки.................................................507 Приложение 3. Где приобрести статистические пакеты...................................................... 508 ПЗ. 1. Универсальные статистические пакеты................... 508 П3.2. Специализированные пакеты............................. 510 ПЗ.З. Цены и телефоны фирм.................................. 512 П3.4. Консультации и обучение................................ 513 Литература..................................................... 514 528