Хотя с другой стороны мат.ожидание Хи2 по контрольной группе составляет 332,6 при стантартном отклонении 97. Т.е. шумовой порог в 509 единиц вполне приличный.
Как я понимаю, в исследовании вы работали с 360 градусами?
Если так, то ставим кол-во степеней свободы в неё, на пример n-1 (можно n-2 или просто n в разных книгах по разному советуется).
т.е. 360-1 = 359
Вероятность в проге измеряется от 0 до 1, а не в процентах.
Если хотим скажем получить вероятность Хи^2 статистикки на уровне значимости, скажем 99,9% то делим это на 100 и вычитаем полученное значение из единицы.
P=1-(99,9/100)=0.001
Вводим это значение в программу.
(остальные парраметры типа кол-ва экспериментов это из другой оперы не обращайте внимания).
В данном случае у нас получилось, что на уровне значимости 99,9% и 359 степенях свободы значение Хи^2 не может быть больше 447,532466822533 ...
что меньше любого из значений....
если я правильно понял то, что вы считали, то получается что
....все ваши результаты статистически значимы.....
LordWilex, спасибо за прогу (скачал на всякий случай). Правда в экселе все это имеется (функция Хи2Расп).
Порог в 509 единиц в контрольной вылез на аспектах Венера-Лилит. А до этого был в 458 единиц, т.е. очень блико к мат.ожиданию + стандартное отклонение = 430.
Ну да, на экселевский rnd часто жалуются, если вы про него...
Тогда могу выложить генератор которым я пользовался, кстати часть той же проги, что и предыдущий файл
там что-то оченнь большой период не повторяемости "случайных" чисел, правда не помню какая, но генератор качественней, чем в эксель, да и ни чего совершенного в этом мире не бывает, если интересно, ночью исходники найду скажу точней.
Я щас пожалуй пойду спатки
Числа распределяются по нормальному закону, есть возможность сгенерировать как целые так и с плавающей точкой (типа юлианские даты).
Да, генератор у Вас отменный. Действительно лучше, чем экселевский. Проверил также генерацию по таблицам случайных чисел. г... такое. Хуже даже чем экселевский. Хотя в умных книжках пишут, что по таблицам самое оно - распределение очень близкое к равномерному. А на поверку оказалось, что вовсе не так. Дисперсия больше, чем в экселевском генераторе.
Если я вас правильно понял, у вас есть большая БД дат рождения совершенно разных людей, в которую включенны множество категорий?
Далее вы делаете из неё случайную выборку и эту выборку сравниваете с исследуемой группой?
Ну тогда я кажется понял в чем может быть ошибка.
Предположим в этой сравнительной БД имеется
1% программистов
2% лыжников
5% космонавтов
и т.д. и.т.п.
Короче, категории распределенны в неравных пропорциях.
Предположим, мы не знаем об этом, но при аспекте Марс - Сев.Узел, резко повышается рождаемость лыжников, космонавтов и алкоголиков.
Тогда, если мы будем сравнивать алкоголиков с контрольной группой, сделанной путем выборки из этой БД, то обнаружим что и там и там кол-во аспекта Марс - Сев.Узел будет привышенно....
Вообще-то я тож сталкивался с такой проблемой и до сих пор не научился с этим бороться на 100%.
В качестве альтернативы могу предложить вам вот какой метод, но предупреждаю сразу он тоже не спасет от ошибок:
Предположим мы исследуем БД в которой даты распределенны неравномерно (а это есть в любой астрологической БД).
Посмотрим, как распределяются в ней даты, и разобъем это дело на сектора (в данном случае на годы, но можно и на меньшее или большее кол-во, на пример на полугодия, или на 5 летки, все зависит от конкретной базы)
На пример:
5% родилось в 1980
7% в 1981
10% в 1982
и т.д. и т.п.
Можно так же попробовать апроксимировать это распределение.
Если у нас есть данные о рождаемости, то желательно вместо такого распределения использовать их, но у нас в России этого трудно достать, поэтому я обхожусь без них.
Далее на генераторе случайных числел генерируем даты в соответствии с этим распределением.
т.е.
5% дат для 1980
7% для 1981
10% для 1982
......
и т.д.
В результате у нас должна получится БД дат весьма (но далеко не на 100%) близкая к тому, с чем мы в идеале хотим сравнить...
Но в этом способе тоже куча недостатков, на прмер для медленных планет могут быть большие косяки.
Но с другой стороны, предположим, по обоим методам (моему и вашему) вероятность ошибки по 10%, но если мы будем их комбинировать, то в соответствии с теоремой умножения вероятностей, вероятость ошибиться использую сразу оба подхода = 0,1*0,1=0,01 :)))))
Основная проблема в том, что тематическая группа всегда является частным случаем контрольной, сформированной из той же БД случайным образом. И основной способ разрешения этой провлемы мне видится в том, чтобы показать, что имеется статистическая зависимость между исследуемым признаком и тематической группой. В противном случае невозможно быть до конца уверенным в действительной значимости результата.
Мне представляется, что 2 случая, когда без контрольной группы не обойтись - это а) аспекты Юпитера и Сатурна между собой и к высшим планетам б) тематические карты, по той же самой причине. Но в таком случае эта выборка должна быть действительно контрольной - то есть, все значимые интервалы времени должны быть заполнены более-менее равномерно, иначе лучше ограничится геометрическим методом, которым я сейчас и пользуюсь.
Да, думаю гораздо проще если их формировать из разных баз, полученных из разных источников, но где их стока взять?
Просто предложенный мной метод хоть и достаточно криво и с определенными погрешностями, но все-таки учитывает такие вещи, как распределение планет по зодиаку в течение исследуемого диапазоно дат и примерную рождаемость.
Ваш метод делает примерно то же самое, но тоже со своими погрешностями.
Думаю, что лучше все методы комбинировать, там мы приблизимся ближе к реальности, хоть заведомо и не достигнем оной :)
А что вы имеете в виду под геометрическим методом?
Фоновая частота попадания планет в знак (для Меркурия, Венеры и Марса) определяется как m/12/k, где m - объём выборки, k - поправка на эллиптичность орбиты, показывает, во сколько раз вероятность попадания планеты в знак больше, чем 1/12.
Фоновая частота аспекта (относительная) удвоенная сумма орбов, поделённая на 360 градусов.
Например - напряжённый аспект Солнца с Плутоном (включая соединение): (6,5*2+6*2+5*4)/360=0,125.
Аспекты в парах Солнце-Марс, Меркурий-Марс, Венера-Марс и у внутренних планет - особа статья
Для тематических карт (равнодомные) - 1/12
Боле-менее полностью моя метода изложена тут:
*
Вот сделал примерчик для выявления статзависимости для Солнца в Козероге. :)
Значица, что на графике и как он был получен. Из сравнительной базы данных случайным образом формировалась выборка объемом 500 карт при условии, что она содержит 1% карт с Солнцем в Козероге.
Для выборки рассчитывается доля страдающих алкоголизмом.
Затем тоже самое для 2%, 3%.... 100%. Потом все это наносится на график.
На самом же графике отображена серия из 10 опытов, каждый опыт - отдельный цвет. Для каждого опыта - линия тренда того же цвета.
Также для каждого опыта рассчитывался коэффициент корреляции. Среднее значение КК для всей серии составляет = 34,56% с доверительной вероятностью 0,043%.
Результат этой серии опытов - положительный. Статистическая зависимость имеется и она значима, а следовательно положение Солнца в Козероге может быть спокойно причислено к одному из факторов алкоголизма.
Хотя играясь со случайными числами на практике нетрудно убедиться, что 300-400 карт все-таки маловато будет, хотя бы один раз на 100 опытов выпадают невероятные события даже при 2000 числел.
Если можно, я перепечатаю вашу статью у себя в блоге, как раз по теме, обратную ссылку и копирайты, конечно же поставлю, не возражаете?
Цитата:
Сообщение от Алексей
Для выборки рассчитывается доля страдающих алкоголизмом.
Затем тоже самое для 2%, 3%.... 100%. Потом все это наносится на график.
Немного не понял, почему именно 1% для солнца в козероге и что значит для "2%, 3%.... 100%", и главное, для чего все это?
т.е. вы делали какое-то ступенчатое распределение?
Хотя играясь со случайными числами на практике нетрудно убедиться, что 300-400 карт все-таки маловато будет, хотя бы один раз на 100 опытов выпадают невероятные события даже при 2000 числел.
Дело в том, что не все тематические выборки такого объёма можно проверить на однородность за приемлемое время и приемлемыми средствами. Конечно, я не призываю, как некоторые исследователи, гордо публиковать результаты статанализа выборки объёмом 23, да ещё без проверки случайности-неслучайности полученных результатов. Но моя практика показывает, что уже начиная с объёма 150 выборки обретаю достаточную устойчивость к увеличению объёма, то есть не менее 75% первоначальных статистически достоверных результатов сохраняются. Разумеется, при условии, что выборка однородна.
Цитата:
Сообщение от LordWilex
Если можно, я перепечатаю вашу статью у себя в блоге, как раз по теме, обратную ссылку и копирайты, конечно же поставлю, не возражаете?
Замечания по применению астрологических баз в качестве контрольной выборки.
Вчерашний вечер посвятил прочёсыванию своей базы 11,5 тысяч записей. Обнаружил повторы дат рождения: 5 дат (день, месяц, год) - 1 раз, 4 даты - 19 раз, 3 даты - более 200 раз. На повторы приходится около 20% всей базы. Не уверен, что в таком состоянии из подобных баз получится корректная контрольная выборка.