Читаем Журнал «Компьютерра» № 25-26 от 11 июля 2006 года (645 и 646 номер) полностью

Итак, t-критерий позволяет оценить, какова вероятность того, что отличия средних двух выборок отражают лишь случайные процессы при их формировании, а F-критерий позволяет сделать то же самое в отношении меры их изменчивости. Увы, нормальность распределения — важнейшее ограничение применимости этих критериев.

Вопреки господствующему мнению, нормальные распределения — редкость в биологии. Одним из классических примеров «нормального» распределения является распределение людей по их росту. Но взгляните на фотографию: распределения мужчин и женщин по росту разные. На фотографии только здоровые люди, и нет больных с нарушениями гормонального баланса. А подумайте, что будет, если к этому распределению добавить стариков и детей!

Нормальность распределения возникает тогда, когда на величину действует много несвязанных слабых факторов. На биологическое разнообразие обычно влияет целый букет «сильных» факторов, связанных друг с другом букетом же корреляций. Эти факторы — пол, возраст, место в иерархической структуре популяции и многое другое. Увы, со «Стьюдентом-Фишером» в большинстве случаев лучше попрощаться.

Для описания новых видов, к счастью, требуют что-то сверх отличий по метрическим признакам (хотя якобы совсем недавно кому-то удалось описать массу новых видов моллюсков почти исключительно на основании достоверных отличий формы раковины). А для обоснования существования подвидов указанные рассуждения используются вовсю.

Корректны ли они? Конечно, нет. И дело не только в том, что t— и F-критерий применимы только для данных с нормальным распределением. Дело в другом. «Стьюдент-Фишер» дает ответ на вопрос, какова вероятность того, что два сравниваемых распределения одного и того же признака взяты из одной генеральной совокупности, и различия между ними — результат случайности при составлении выборки. Если эта вероятность (p) ниже какого-то уровня (например, 0,05), мы можем рискнуть и принять гипотезу, что выборки взяты из разных совокупностей. Это и называется достоверностью различий. И все. Отсюда есть два следствия.

Первое. Когда мы сравниваем уклеек из двух разных рек, мы и так с самого начала знаем, что это выборки из разных совокупностей. Второе. При уровне значимости 0,05 достоверное отличие — это такое отличие, которое возникает не чаще, чем в одном случае из двадцати. А если мы будем сравнивать выборки по ста признакам (или сто пар выборок по одному признаку), математическое ожидание «достоверных» отличий составит целых пять штук!

Беру две группы по пятьдесят объектов, характеризую их по ста признакам, заполняя столбцы шумом. Сравниваю по «Стьюденту-Фишеру». Получаю шесть «достоверных» отличий, из которых три штуки влезают в первый же скрин (рис. 6). Ну что, теперь можно анализировать, какие именно признаки оказались достоверно отличающимися, и делать на основании этого глубокомысленные выводы о специфике эволюции уклеек в бассейнах двух рек…

Мои рассуждения кажутся вам примитивными? Возьмите любой сборник или журнал с подобными по методологии работами и вы сами сможете найти примеры такого употребления статистических методов.

Что же делать? Для сравнения выборок по признакам, которые не подчиняются нормальному распределению, использовать непараметрические методы. Для сравнения нескольких объектов одновременно использовать дисперсионный анализ. Для сравнения одновременно по нескольким признакам использовать многомерные критерии. Для оценки уровня отличий между разными совокупностями вычислять фенетические дистанции (численные меры того, насколько отличаются друг от друга две выборки). И аккуратнее использовать статистические методы.

Самообман

Мы начали статью с особенностей работы в программе Statistica. Однако ясно, что сама по себе проблема использования численных методов в биологии шире этой программы. В следующем примере речь идет о математическом моделировании эволюции, однако и эту работу можно рассматривать как связанную с биометрией и статистикой. В отличие от предыдущих, этот пример невозможно сделать анонимным — уж слишком широкую огласку он получил. Описывая его, я сошлюсь на «Происхождение видов» Дарвина. Чтобы объяснить, при чем тут Дарвин, нужно немного уйти в сторону.

Перейти на страницу:

Все книги серии Компьютерра

Похожие книги

«Если», 2002 № 11
«Если», 2002 № 11

ФАНТАСТИКАЕжемесячный журналСодержание:Ф. Гвинплейн Макинтайр. В НЯНЬКАХ У КОТИКА ШРЁДИНГЕРА, рассказОлег Дивов. ПАРАНОИК НИКАНОР, рассказВернисаж*Вл. Гаков. ПО ШОМБУРГСКОМУ СЧЕТУ (статья)Чарльз Шеффилд. НЕЗАКОННАЯ КОПИЯ, рассказРодриго Гарсиа-и-Робертсон. СУДОВЫЕ КРЫСЫ, повестьСергей Дерябин. КОМПЬЮТЕР В ГОЛОВЕ (статья)Андрей Саломатов. ПОСТОРОННИЕ, рассказМарина и Сергей Дяченко. СУДЬЯ, рассказВидеодром*Тема--- Дмитрий Караваев. НАШЕСТВИЕ ЧЛЕНИСТОНОГИХ (статья)*Рецензии*Экранизация--- Вячеслав Яшин. РОК-Н-РОЛЛ ИЗ СКЛЕПА (статья)*Дебют--- Андрей Щербак-Жуков. ПОДОЖДЕМ ЛЕТ ДЕСЯТЬ (статья)Уолтер Йон Уильямс. МИР ПАПОЧКИ, рассказМайкл Суэнвик. ВЕЛИКИЙ ДЕНЬ БРОНТОЗАВРА, рассказДмитрий Володихин. ХУТОРЯНЕ (статья)РецензииВалентин Волчонок. ГАПОЛОГИЯ (статья)Экспертиза темы // Авторы: Игорь Нагаев, Владислав Крапивин, Эдуард ГеворкянВладимир Борисов. СЫН НЕБА (статья)КурсорPersonaliaОбложка Игоря Тарачкова к повести Родриго Гарсиа-и-Робертсона «Судовые крысы». Иллюстрации: А. Балдин, С. Голосов, А. Филиппов, И. Тарачков, В. Овчинников, О. Дунаева, А. Шомбург    

Марина и Сергей Дяченко , Сергей Дерябин , Валентин Волчонок , Родриго Гарсиа-и-Робертсон , МАЙКЛ СУЭНВИК

Журналы, газеты / Фантастика / Научная Фантастика