Перейти к содержимому
Российский открытый архив препринтов — arXivorg Открытый архив препринтов Telegram MAX О проекте Вход для авторов
Добавить статью Вход для авторов
Подписаться на канал:

Главная · Справочник · Теорема Байеса

Теорема Байеса: формула, смысл и разбор на примере

Обновлено: август 2026

Теорема Байеса пересчитывает вероятность гипотезы после получения новых данных. Формула связывает две условные вероятности: то, что мы хотим знать (вероятность гипотезы при наблюдённых данных), и то, что нам обычно известно (вероятность таких данных при верной гипотезе). Главный практический вывод: результат сильно зависит от исходной распространённости явления, и именно её интуиция игнорирует.
Коротко:
  • P(H|D) = P(D|H) · P(H) / P(D) — апостериорная вероятность через априорную.
  • P(H) — априорная вероятность, то есть распространённость до получения данных.
  • P(D|H) и P(H|D) — разные величины; их смешение называют ошибкой прокурора.
  • При редком явлении даже точный тест даёт много ложноположительных результатов.
  • Формула не создаёт информацию: качество вывода определяется качеством априорной оценки.

Как записывается формула

В базовом виде: P(H|D) = P(D|H) · P(H) / P(D). Здесь H — гипотеза, D — наблюдённые данные. Знаменатель раскрывается через полную вероятность: P(D) = P(D|H)·P(H) + P(D|¬H)·P(¬H), что и делает формулу пригодной для расчёта.

Смысл каждого множителя: P(H) — что мы думали до наблюдения, P(D|H) — насколько наблюдение ожидаемо при верной гипотезе, P(H|D) — что следует думать после. Теорема описывает именно обновление убеждения, а не вычисление истины.

Почему интуиция ошибается в теореме Байеса

Люди устойчиво подменяют P(H|D) на P(D|H). Пример: тест на редкое заболевание с чувствительностью и специфичностью 99 % дал положительный результат. Кажется, что вероятность болезни 99 %. На самом деле она зависит от распространённости.

При распространённости 1 на 1000 на 100 000 человек приходится 100 больных (99 из них тест выявит) и 99 900 здоровых, из которых 1 % — то есть 999 человек — получат ложноположительный результат. Итого положительных 1098, из них действительно больны 99: вероятность болезни около 9 %, а не 99 %.

ВеличинаЗначение в примереЧто означает
распространённость P(H)0,0011 случай на 1000 человек
чувствительность P(D|H)0,99доля выявленных среди больных
специфичность0,99доля отрицательных среди здоровых
ложноположительных999 на 100 000здоровые с положительным результатом
истинно положительных99 на 100 000больные с положительным результатом
итог P(H|D)≈ 0,09вероятность болезни после теста

Что такое априорная вероятность и откуда её брать

Априорная вероятность — оценка до получения данных. В медицине это распространённость в популяции или в конкретной группе; в технике — известная частота отказов; в судебной аргументации — доля людей, к которым версия применима.

Слабое место метода именно здесь: плохая априорная оценка портит вывод независимо от качества данных. Когда обоснованной оценки нет, разумно показать, как меняется результат при разных допущениях, а не выбирать одно молча.

Где формула применяется

Диагностика — самый наглядный случай: интерпретация результата теста без учёта распространённости систематически завышает риск. Техническая диагностика и надёжность — оценка вероятности отказа по показаниям датчика. Фильтрация сообщений — классические спам-фильтры построены прямо на этой формуле.

Отдельная область — байесовская статистика, где теорема применяется не к отдельным событиям, а к параметрам моделей: априорное распределение параметра обновляется данными и даёт апостериорное.

Частые ошибки при применении

Первая и главная — игнорирование базовой частоты. Её последствия показаны выше: при редком явлении вывод меняется на порядок.

Вторая — подмена условных вероятностей местами. «Вероятность такого совпадения, если человек невиновен, мала» и «вероятность невиновности мала» — разные утверждения, и второе из первого не следует.

Третья — повторное использование одних данных как независимых. Два коррелированных признака, применённые как независимые, завышают уверенность: формула для независимых наблюдений здесь неприменима.

Пока журнал рецензирует — препринт закрепляет приоритет

арХиворг.ру — открытый архив препринтов по физике, математике, Computer Science и инженерии. Если ваша работа из этих или смежных областей, вы можете бесплатно закрепить приоритет уже сегодня.

Читать препринты

Частые вопросы

Чем априорная вероятность отличается от апостериорной?

Априорная — оценка до учёта данных, апостериорная — после. Апостериорная вероятность одного шага может служить априорной для следующего: так формула работает при последовательном поступлении наблюдений.

Что такое ошибка прокурора?

Смешение P(данные|невиновен) с P(невиновен|данные). Малая вероятность случайного совпадения не означает малую вероятность невиновности: нужно учесть, сколько людей вообще могло дать такое совпадение.

Нужна ли формула, если данных очень много?

При большом объёме данных влияние априорной оценки ослабевает, и результаты байесовского и частотного подходов сближаются. Разница принципиальна как раз при малых выборках и редких событиях.

Как выбрать априорное распределение в байесовской статистике?

Варианты: неинформативное, слабо информативное или основанное на предыдущих исследованиях. Правило одно — выбор нужно объявить и показать, насколько выводы к нему чувствительны.

Смотрите также: Справочник · Нормальное распределение · Калькулятор диагностической точности · Меры эффекта: ОР, ОШ, ЧБНЛ · Распределение Лапласа · Ковариация и корреляция

арХиворг.ру — независимый российский открытый архив научных препринтов по физике, математике, Computer Science и инженерии; он не является рецензируемым журналом, изданием Перечня ВАК и не индексируется в РИНЦ. Сведения носят справочный характер — актуальные требования проверяйте на официальных сайтах изданий и профильных реестров.