N.4 · не-парадокс · подтип: Контринтуитивный результат

False Positive

Суть ошибки. Корректный результат: теорема Байеса

Точная формулировка

Болезнь встречается у одного человека из тысячи. Тест надёжен на 99%: болезнь он ловит почти всегда, здоровому даёт ложную тревогу в 1% случаев. Ваш тест положителен. Какова вероятность, что вы больны? Интуиция: 99%. Верный ответ: около 9%. Из тысячи протестированных положительный результат получат один больной и примерно десять здоровых — вы один из одиннадцати.

Происхождение

Классический замер провели Кассельс, Шёнбергер и Грабойс (1978), опросив врачей и студентов Гарвардской медицинской школы на близкой задаче: большинство ответило «95%» при верных ~2% — ошибались те, кто ставит диагнозы ежедневно. Канеман и Тверски к тому времени уже описали механизм — пренебрежение базовой частотой (задача о такси); Эдди показал масштаб беды в медицинской практике; Гигеренцер нашёл противоядие — натуральные частоты: тот же вопрос, заданный в людях («из 1000 — один и десять…») вместо процентов, решается большинством правильно. Судебная тень узла — «прокурорская ошибка»: подмена «вероятности улики при невиновности» «вероятностью невиновности при улике»; дело Салли Кларк (1999) — трагический памятник этой подмене.

Почему это не парадокс

Ни задача, ни теорема Байеса не содержат дефекта — дефект в ожидании: интуиция читает «точность теста 99%» как ответ на вопрос пациента, а это ответы на разные вопросы. Точность — вероятность результата при известном состоянии: P(положителен | болен). Пациент спрашивает обратное: P(болен | положителен). Стрелка условия развёрнута — а обратный ход не бесплатен: он взвешивается составом популяции, и при редкой болезни (1 на 1000) толпа здоровых даже с малым процентом ложных тревог поставляет больше положительных, чем горстка больных. Ожидание симметрии условной вероятности — то же смешение, что «все кошки — животные, значит, все животные — кошки», только в вероятностной одежде.

Доменный анализ

Домен 1 — Распознавание: что дано? Компоненты: базовая частота (1/1000), чувствительность, доля ложных тревог, положительный результат, вопрос «болен ли я». Сигнал: в вопросе и в данных стрелки условия смотрят в разные стороны.

Домен 2 — Прояснение: что означают термины? Здесь дефект ожидания. «Тест точен на 99%» — свойство теста при фиксированном состоянии; «вероятность, что я болен» — свойство моей ситуации при фиксированном результате. Разные условные вероятности; равными они бывают лишь случайно. Сигнал: инверсия условия принята за тождество.

Домен 3 — Выбор рамки: рамка «качество прибора решает» не по объекту: ответ живёт на тройке (чувствительность, ложные тревоги, базовая частота), и третий член — главный при редких событиях.

Домен 4 — Сравнение: решающее сравнение — двух потоков положительных: от больных (~1 из 1000) и от здоровых (~10 из 999); их отношение и есть ответ.

Домен 5 — Вывод: счёт Байеса безупречен и проверяется пересчётом в людях. Проблема не в задаче.

Домен 6 — Рефлексия: «точный тест — почему же 9%?» — сигнал пересчитать в натуральных частотах; удивление снимается тысячей воображаемых пациентов.

Диагноз

Категория: не-парадокс — контринтуитивный результат. Место дефекта: ожидание — инверсия условной вероятности и пренебрежение базовой частотой. Нарушенных законов нет. На триаде E/R/R: точность теста — Правило, ведущее от состояния к результату; вопрос пациента идёт против стрелки Правила, и обратный ход обязан взвеситься составом Элементов (базовой частотой) — интуиция же читает Правило как симметричное и состав не спрашивает.

Разрешение

Натуральные частоты решают задачу устно. Возьмите тысячу человек. Болен один — тест его почти наверняка покажет: один истинный положительный. Здоровых 999 — один процент ложных тревог даёт примерно десять ложных положительных. Всего положительных — одиннадцать; больной среди них один: P(болен | положителен) = 1/11 ≈ 9%. Формула Байеса говорит то же самое в одну строку — но частоты объясняют, почему: при редкой болезни толпа здоровых перевешивает горстку больных даже при отличном тесте. Отсюда практика: положительный скрининг редкого — повод для второго, независимого теста (после которого база уже не 1/1000, а 1/11 — и второй положительный весит много), а не для приговора. И судебное зеркало: «вероятность такой улики у невиновного — один к миллиону» не есть «вероятность невиновности — один к миллиону»; без базовой частоты — сколько людей могли оставить такую улику — число обвинения не значит ничего.

Урок

О стрелке условия. P(A|B) и P(B|A) — разные величины; их подмена — вероятностная форма обращения импликации. О базовой частоте. При редких событиях состав популяции весит больше качества прибора; вопрос «сколько таких вообще» — первый, не последний. О представлении. Проценты прячут структуру, люди её показывают: пересчёт в натуральные частоты — самый дешёвый детектор этой ошибки. О цене. Ошибка живёт не в задачниках — в клиниках и судах; узнавать её — гигиена решений о людях.

Родня по механизму

Монти Холл (информационная структура против картинки), Дни рождения (носитель события), Симпсон (веса состава — тот же третий член), прокурорская ошибка и задача о такси Канемана-Тверски (прямые формы того же смешения).

Машинная проверка. В реестре 46 — N4_FalsePositive: категория NonParadox; статус категории формализован (nonparadox_46_not_paradox, nonparadox_count_8 — ParadoxDissolution.v). Счёт 1/11 — точная дробь: натуральные частоты — чистая Q-арифметика, первый кандидат формализации ветки «Вероятность» (см. Формализация).


Категория: Не-парадоксы · Каталог: Каталог парадоксов · Концепт: Парадокс