# Схема наблюдения в статистике обобщённых репьюнитных простых: калибровка объединённой проверки константы Ленстры — Померанса — Вагстаффа

Эвристика Ленстры — Померанса — Вагстаффа &#40;ЛПВ&#41; предсказывает, что #{ ≤ : &#40; &#41; просто} ∼ &#40; / ln &#41; ln . С 1993 года эту универсальность проверяют через «нормированную частоту встречаемости», получаемую регрессией ln на . Во-первых, подозрение о смещении этой частоты правым цензурированием неверно: и концевая форма, и наклон МНК несмещены точно &#40;предложение 2&#41;; смещена лишь обратная величина — неравенство Йенсена. Дефект иной: варианты оценки расходятся до 29,5&#37; — в 1,7 раза больше медианного отклонения от − , — и ярлык «удачливости» основания переворачивается от смены формы. Во-вторых, точное условное правдоподобие вместо регрессии объединяет = 15 оснований в = 218 событий против 51 у одних простых Мерсенна. Главное: пивот ∼ Gamma&#40; , 1&#41; точен лишь при наблюдении «до -го события», а данные полу- чены при фиксированном фронте со случайным числом находок. При реальной схеме номинальный 5&#37; критерий отвергает в 16,2&#37; случаев, а верной объединённой оценкой оказывается &#40; − &#41;/ , а не &#40; − 1&#41;/ : условное правдоподобие стоит одного события на каждое основание. Отсюда ^ = 1,838 при 95&#37; интервале [1,61; 2,13] и = 0,64 против ≈ 1,781; сообщавшееся десятипроцентное превышение над ЛПВ есть артефакт схемы наблюдения. В-третьих, выбор между двумя оценками определяется способом сбора данных, а не самими данными, и стоит 7&#37;; отсюда требование публиковать фронты . Наконец, критерий однородности &#40;Λ = 7,40, = 0,92&#41; различает лишь разброс свыше ±34&#37;, а объединённая выборка — отклонения от свыше 21&#37;.

| Поле | Значение |
|---|---|
| Автор | Докучаев Тимофей Сергеевич |
| Организация | Нет |
| Раздел | Математика |
| Опубликовано | 06.09.2026 |
| Идентификатор | AX-135915 |
| Лицензия | CC BY 4.0 |
| Ключевые слова | репьюнит-простые, обобщённые репьюниты, числа Мерсенна, гипотеза Ленстры --- Померанса --- Вагстаффа, постоянная Эйлера --- Маскерони, схема наблюдения, цензурирование типа~I, обратная выборка, пуассоновский точечный процесс, условное правдоподобие, доста |

Полный текст (PDF): https://arxivorg.ru/upload/iblock/b33/gjkxjlpjgjjooddwwg8anen4pkz3fmf0/paper%20%286%29.pdf
Источник (HTML): https://arxivorg.ru/mathematics/skhema-nablyudeniya-v-statistike-obobshchyennykh-repyunitnykh-prostykh-kalibrovk/
Архив: арХиворг.ру — открытый архив научных препринтов на русском языке.

## Полный текст

Научная статья\\
 УДК 511.3:519.234
 abstract
Эвристика Ленстры — Померанса — Вагстаффа (ЛПВ) предсказывает, что
\(\#\{n\le x:\Rb(n)\ \text{просто}\}\sim(\eg/\ln b)\ln x\). С 1993 года эту универсальность проверяют через
&lt;&lt;нормированную частоту встречаемости&gt;&gt;, получаемую регрессией \(\ln n_k\) на \(k\).

Во-первых, подозрение о смещении этой частоты правым цензурированием
неверно: и концевая форма, и наклон МНК несмещены точно
(предложение ); смещена лишь обратная величина — неравенство
Йенсена. Дефект иной: варианты оценки расходятся до \(29{,}5\%\) — в \(1{,}7\) раза
больше медианного отклонения от \(\emg\), — и ярлык &lt;&lt;удачливости&gt;&gt; основания
переворачивается от смены формы.

Во-вторых, точное условное правдоподобие вместо регрессии объединяет \(B=15\)
оснований в \(M=218\) событий против \(51\) у одних простых Мерсенна. Главное: пивот
\(\kappa S\sim\Gam(M,1)\) точен лишь при наблюдении &lt;&lt;до \(N\)-го события&gt;&gt;, а данные
получены при фиксированном фронте со случайным числом находок. При реальной схеме номинальный \(5\%\)
критерий отвергает в \(16{,}2\%\) случаев, а верной объединённой оценкой оказывается
\((M-B)/S\), а не \((M-1)/S\): условное правдоподобие стоит одного события на
каждое основание. Отсюда \(\hat\kappa=1{,}838\) при \(95\%\) интервале
\([1{,}61;\,2{,}13]\) и \(p=0{,}64\) против \(\eg\approx1{,}781\); сообщавшееся
десятипроцентное превышение над ЛПВ есть артефакт схемы наблюдения.

В-третьих, выбор между двумя оценками определяется способом сбора данных, а не
самими данными, и стоит \(7\%\); отсюда требование публиковать фронты \(L_b\).
Наконец, критерий однородности (\(\Lambda=7{,}40\), \(p=0{,}92\)) различает лишь
разброс \(\kappa_b\) свыше \(\pm34\%\), а объединённая выборка — отклонения от
\(\eg\) свыше \(21\%\).

Ключевые слова: репьюнит-простые, обобщённые репьюниты,
числа Мерсенна, гипотеза Ленстры — Померанса — Вагстаффа, постоянная
Эйлера — Маскерони, схема наблюдения, цензурирование типа I, обратная
выборка, пуассоновский точечный процесс, условное правдоподобие, достаточная
статистика, смещение оценки, мощность критерия, вычислительная теория чисел

MSC 2020: Primary 11Y11; Secondary 11N05, 62F03, 62B05, 11N80.

Благодарности: автор благодарит проект Great Internet Mersenne
Prime Search (GIMPS) за предоставление данных о простых числах Мерсенна через
открытый отчёт PrimeNet (); значения индексов
Мерсенна получены оттуда 27 августа 2026 года. Автор признателен участникам
OEIS, которые много лет поддерживают последовательности обобщённых репьюнитных
простых.

Финансирование: исследование выполнено без внешнего
финансирования.
 abstract

otherlanguageenglish

center
 The observation scheme in the statistics of generalized\\
repunit primes: calibrating the pooled test of the\\
Lenstra–Pomerance–Wagstaff constant

Timofei Sergeevich Dokuchaev

Independent researcher, Irkutsk, Russia,\\
timofei93@yandex.ru, 
 center

abstract
 The Lenstra–Pomerance–Wagstaff (LPW) heuristic
predicts \(\#\{n\le x: (b^n-1)/(b-1)\ \text{prime}\}\sim(e^{\gamma}/\ln b)\ln x\).
Since 1993 it has been tested via a «normalised occurrence frequency» from
regressing \(\ln n_k\) on \(k\).

First, the suspicion that right-censoring biases this frequency downwards is
false: both the endpoint form and the OLS slope are exactly unbiased; only
the reciprocal is biased — Jensen&#039;s inequality. The genuine defect is that
competing forms of the estimator disagree by up to \(29.5\%\) on identical data, and the
«lucky base» label flips between them.

Second, an exact conditional likelihood pools \(B=15\) bases into \(M=218\) events
against \(51\) for Mersenne primes alone. The main result concerns the pivot:
it is exact only under inverse sampling, whereas the data arise from a
fixed frontier with a random number of finds. Under the latter the nominal \(5\%\)
test rejects in \(16.2\%\) of cases, and the correct pooled estimator is \((M-B)/S\),
not \((M-1)/S\): the conditional likelihood costs one event per base. This
yields \(\hat\kappa=1.838\), \(95\%\) interval \([1.61,\,2.13]\), \(p=0.64\) against
\(e^{\gamma}\approx1.781\); the reported ten-percent excess is an artefact of the
scheme.

Third, the choice between the two estimators is settled by how the data were
collected, not by the data, and costs \(7\%\); hence our call to publish the
frontiers \(L_b\). Finally, the homogeneity test (\(\Lambda=7.40\), \(p=0.92\)) detects
only a spread of \(\kappa_b\) above \(\pm34\%\), the pooled sample only deviations
above \(21\%\).

Keywords: repunit primes, generalized repunits, Mersenne
primes, Lenstra–Pomerance–Wagstaff conjecture, Euler–Mascheroni constant,
observation scheme, Type-I censoring, inverse sampling, Poisson point process,
conditional likelihood, sufficient statistic, estimator bias, statistical
power, computational number theory

Acknowledgments: the author thanks the Great Internet Mersenne
Prime Search (GIMPS) project for providing the Mersenne prime data through the
open PrimeNet report (); the Mersenne exponents
were retrieved on 27 August 2026. The author is grateful to the OEIS contributors
who have maintained the generalized repunit prime sequences for many years.

Funding: this research received no external funding.
 abstract
 otherlanguage

Введение

Для целого основания \(b\ge2\) обобщённый репьюнит есть
\[\label{eq:Rb}
\Rb(n)=\frac{b^{n}-1}{b-1},\]
причём \(\Rb(n)\) может быть простым только при простом \(n\). При \(b=2\) это числа Мерсенна
\(M_p=2^{p}-1\). Опираясь на эвристики Вагстаффа [wagstaff1983] и
Померанса [pomerance1981], гипотеза ЛПВ утверждает, что
\[\label{eq:LPW}
\pi_b(x)=\#\{n\le x:\ \Rb(n)\ \text{простое}\}\ \sim\ \frac{\eg}{\ln b}\,\ln x,\]
где \(\gamma\) — постоянная Эйлера — Маскерони; подробный вывод эвристики для
\(b=2\) изложен в справочнике PrimePages [t5k]. Основание входит
в лишь через множитель \(1/\ln b\): константа \(\eg\approx1{,}7811\)
объявляется универсальной.
Дабнер [dubner1993] предложил проверять эту универсальность эмпирически по разным
основаниям, а Бурделэ [bourdelais2009] с тех пор ведёт текущие оценки нормированной
частоты, публикуя их в комментариях к записям OEIS [oeis]. Родственные вопросы для
одной лишь последовательности Мерсенна недавно обсуждались в [wagstaff2025].
Близка по духу и работа [dominguez2026], где у показателей Мерсенна ищут
вторичную структуру, связанную с разложением \(p-1\); методически она устроена так же,
как наш — стратифицированное условное правдоподобие плюс
проверка значимости, — но проверяет структуру внутри одного основания,
тогда как мы проверяем её между основаниями.

Вокруг этих оценок сложился интерпретационный фольклор. Основание 13 описывается как
&lt;&lt;удачливое&gt;&gt;, основание 7 — как &lt;&lt;самое неудачливое&gt;&gt;; отмечается, что нормированные
частоты лежат ниже предполагаемого предела \(\emg\approx0{,}5615\) и медленно сходятся
к нему снизу. Настоящая работа разбирает эти утверждения, но приходит к выводам,
отличным от тех, которых естественно ожидать.

Вклад работы

OL
• Употребительная оценка частоты не смещена. Схема, при которой интервал
подгонки заканчивается наибольшим известным индексом, действительно обусловливает
оценку тем, что последнее наблюдение является событием, и достаточная статистика
распределена как \(\Gam(N,\lambda_b)\) (предложение ). Но отсюда
не следует смещение нормированной частоты: и концевая форма
\(D/(N\ln b)\), и наклон МНК несмещены точно (предложение ,
таблица ). Смещена только обратная величина
\(\hat\kappa=1/\hat G\), в \(N/(N-1)\) раз, и это неравенство Йенсена, а не цензурирование.
Несмещённые оценки \(\kappa\) и \(1/\kappa\) не могут быть взаимно обратными; всякая
&lt;&lt;поправка&gt;&gt;, чинящая одну, портит другую ( ).

• Настоящий дефект — неустойчивость к выбору формы оценки.
В обращении несколько численно различных вариантов. На одних и тех же данных они
расходятся до \(29{,}5\%\) (основание 18) — в \(1{,}7\) раза больше медианного
отклонения оценок от \(\emg\) (\(17{,}6\%\)), которое и толкуют содержательно; у двух
оснований из пятнадцати выбор формы весит больше, чем всё их отклонение от
предсказания ЛПВ. Основание 18 при концевой форме — третье
по &lt;&lt;неудачливости&gt;&gt; из пятнадцати, а при МНК — десятое, ниже медианы. Ярлык
описывает выбор оценки, а не свойства простых ( ).

• Объединение оснований и его цена. Условное правдоподобие
( ) не требует знания недокументированных границ поиска \(L_b\) и
позволяет объединить \(B=15\) оснований в \(M=218\) событий против \(51\) у одних
Мерсенна. Точное нулевое распределение \(\Gam(M,1)\) делает симуляции ненужными.

• Главный результат: пивот не откалиброван под реальную схему наблюдения.
Условное правдоподобие точно при схеме &lt;&lt;наблюдаем до \(N\)-го события&gt;&gt;, где \(N\) задано
планом. Данные же получены при фиксированном фронте: поиск покрыл \((t_0,\ln L_b]\), а число
находок случайно. При этой схеме номинальный \(5\%\) критерий отвергает
в \(16{,}2\%\) случаев, а правильной объединённой оценкой оказывается \((M-B)/S\)
(предложение ). Само различие схем классическое, а несмещённость
\((N-1)/D\) при схеме A учебникова, и мы на неё не претендуем; новизна в том, что
фронт не документирован, поэтому экспозицию приходится восстанавливать
из самих находок, и поправка оказывается пропорциональна числу оснований
(замечание ). Это даёт \(\hat\kappa=1{,}838\) при \(p=0{,}64\):
превышение над ЛПВ исчезает ( ).

• Выбор схемы данными не решается. Оценки \((M-1)/S\) и \((M-B)/S\) построены
на одних и тех же достаточных статистиках \((N_b,D_b)\) и различаются на \(7\%\);
что из них верно, определяется не данными, а тем, как они собирались. Попытка обойти
выбор через заведомо несмещённые по-основанию куски проваливается
( ). Единственный радикальный выход — публиковать фронты \(L_b\).

• Удачливые основания: чего критерий не может. Критерий отношения
правдоподобий даёт \(\Lambda=7{,}40\) при \(14\) степенях свободы, \(p=0{,}92\). Но его
мощность такова, что он различает лишь разброс \(\kappa_b\) порядка \(\pm34\%\)
( ). Корректный вывод — &lt;&lt;базозависимые частоты данными не
требуются&gt;&gt;, а не &lt;&lt;их не существует&gt;&gt;.

• Явный расчёт мощности. Объединённая выборка различает отклонения от
\(\eg\) не менее \(21{,}2\%\); одна последовательность Мерсенна — не менее \(49{,}8\%\)
( ).
/OL

В разобран более частный, но поучительный сюжет: наивная регрессия
счётной функции Мерсенна порождает на вид значимый отрицательный свободный член,
который оказывается артефактом обусловливания. Мы включаем его как разобранный пример
той же ошибки в ином обличье.

Модель и данные

Пуассоновская модель

Положим \(t=\ln n\). Эвристика равносильна утверждению, что индексы
обобщённых репьюнитных простых по основанию \(b\) образуют однородный пуассоновский
точечный процесс на оси \(t\) с постоянной интенсивностью
\[\label{eq:lam}
\lambda_b=\frac{\kappa}{\ln b},\qquad \text{ЛПВ:}\ \ \kappa=\eg=1{,}781072\ldots\]
Универсальность — это утверждение, что единственный параметр \(\kappa\) управляет всеми
основаниями. Пуассоновская идеализация здесь — рабочее допущение, а не теорема:
даже для обычных простых пуассоновский закон в коротких промежутках доказан лишь
условно, при гипотезах Харди — Литтлвуда, и известно, что он разрушается при росте
масштаба [jha2026]. Мы принимаем как модель и всюду рассматриваем
\(\kappa\) как оцениваемую величину; это сводит вопрос &lt;&lt;верна ли ЛПВ?&gt;&gt; к однопараметрическому и
делает основания объединяемыми.

Допустимые основания

Основания, являющиеся точными степенями, исключаются: при \(b=c^{m}\), \(m&gt;1\), число
\(\Rb(n)\) допускает алгебраическую факторизацию, и процесс не имеет предполагаемого вида.
Поэтому основания \(4,8,9,16\) опущены. Внутри объявленного диапазона отбор
не зависит от результатов: берутся все основания \(2\le b\le20\), не являющиеся
точными степенями, что даёт \(B=15\); ни одно основание не исключено и не добавлено
по величине его оценки. Каждое из них имеет не менее восьми известных индексов
(минимум достигается при \(b=18\): восемь членов A133857).

Подчеркнём, однако, что сама верхняя граница \(b\le20\) — условная круглая величина,
а не следствие критерия &lt;&lt;не менее восьми индексов&gt;&gt;: этот критерий выполняется и
дальше (A127996 для \(b=21\) содержит восемь членов, A127997 для \(b=22\) — девять) и
впервые нарушается лишь при \(b=23\) (A204940, шесть членов). Чтобы граница не выглядела
подобранной, мы проверили её влияние прямо. Расширение набора до всех оснований
\(b\le26\), не являющихся точными степенями (добавляются \(b=21,22,23,24,26\); \(b=25=5^2\)
исключается алгебраически), даёт \(B=20\), \(M=253\) и
\[\frac{M-1}{S}=1{,}9776,\qquad \frac{M-B}{S}=1{,}8285,\]
то есть сдвигает основную оценку на \(0{,}5\%\) — вчетверо меньше
цены выбора схемы наблюдения ( ). Критерий однородности на расширенном
наборе даёт \(\Lambda=10{,}27\) при \(19\) степенях свободы, \(p=0{,}95\). Ни один вывод
работы от границы \(b\le20\) не зависит; мы сохраняем её как заранее объявленную.

Данные и их статус

В таблице перечислены использованные последовательности,
полученные 27 августа 2026 года (сверка — приложение ).
Три оговорки существенны.

Вероятно простые числа. Для больших индексов большинство элементов —
вероятно простые, установленные тестом Ферма или сильным тестом Ферма после пробного
деления. Счёт смещается вверх лишь в случае, если псевдопростое Ферма было принято за
простое, что для чисел такого размера практически не встречается. Чувствительность
проверена в .

Фронты проверки. Для \(b=2\) проект GIMPS [gimps] публикует два фронта:
все показатели ниже \(X_{\mathrm{ver}}=81\,648\,221\) проверены дважды, что даёт ровно \(50\)
простых Мерсенна, тогда как все показатели ниже \(X_{\mathrm{ft}}=141\,308\,443\) проверены
хотя бы однократно, что даёт \(52\). Два наибольших показателя предварительны: между ними
остаются непроверенные кандидаты. Анализ , где фронт используется
явно, ограничен \(50\) проверенными показателями. Объединённый анализ к этому выбору
нечувствителен ( ).

Оба фронта — движущиеся величины, поэтому фиксируем момент считывания: отчёт
PrimeNet Milestones, 27 августа 2026 г. Ни один вывод от точного значения
\(X_{\mathrm{ver}}\) не зависит: достаточно того, что оно лежит между
\(M_{50}=77\,232\,917\) и \(M_{51}=82\,589\,933\), а это верно для всех значений отчёта
за 2026 год.

Статус записи A000043. Раздел DATA этой записи содержит \(50\) членов и
обрывается на \(77\,232\,917\): порядок следующих показателей OEIS считает недоказанным
до завершения двойной проверки. Показатели \(82\,589\,933\) и \(136\,279\,841\) известны и
документированы GIMPS (и упомянуты в комментариях к A000043), но формально не входят в
DATA. Мы включаем их, поскольку статистика использует лишь положение
последнего события, а не его порядковый номер; в проверено, что
ограничение основания 2 пятьюдесятью дважды проверенными показателями вывода не меняет.

Границы поиска при \(b&gt;2\). Для прочих оснований сопоставимого фронта не
публикуется. Именно эта лакуна — предмет и, как мы полагаем,
главное препятствие к количественной проверке ЛПВ.

table[t]
 Использованные последовательности. \(N_b\) — число событий строго правее
\(t_0=\ln n_{\min}\), то есть на единицу меньше числа известных простых индексов:
наименьший индекс задаёт начало отсчёта, а не событие. Источник — записи OEIS,
получено 27.08.2026.
 Sequences used. \(N_b\) is the number of events strictly to the right of
\(t_0=\ln n_{\min}\), that is, one less than the number of known prime indices: the
smallest index sets the origin, not an event. Source: OEIS entries, retrieved
27.08.2026.

tabularrlrrrrr
 \(b\) &amp; OEIS &amp; простых &amp; \(N_b\) &amp; \(n_{\min}\) &amp; \(n_{\max}\) &amp; \(D_b\)\\
 2 &amp; A000043 &amp; 52 &amp; 51 &amp; 2 &amp; 136\,279\,841 &amp; 18,0371\\
3 &amp; A028491 &amp; 23 &amp; 22 &amp; 3 &amp; 8\,530\,117 &amp; 14,8605\\
5 &amp; A004061 &amp; 19 &amp; 18 &amp; 3 &amp; 3\,300\,593 &amp; 13,9110\\
6 &amp; A004062 &amp; 17 &amp; 16 &amp; 2 &amp; 3\,360\,347 &amp; 14,3344\\
7 &amp; A004063 &amp; 10 &amp; 9 &amp; 5 &amp; 1\,264\,699 &amp; 12,4409\\
10 &amp; A004023 &amp; 11 &amp; 10 &amp; 2 &amp; 8\,177\,207 &amp; 15,2237\\
11 &amp; A005808 &amp; 13 &amp; 12 &amp; 17 &amp; 1\,868\,983 &amp; 11,6077\\
12 &amp; A004064 &amp; 14 &amp; 13 &amp; 2 &amp; 769\,543 &amp; 12,8604\\
13 &amp; A016054 &amp; 13 &amp; 12 &amp; 5 &amp; 1\,503\,503 &amp; 12,6139\\
14 &amp; A006032 &amp; 11 &amp; 10 &amp; 3 &amp; 1\,724\,417 &amp; 13,2618\\
15 &amp; A006033 &amp; 10 &amp; 9 &amp; 3 &amp; 639\,833 &amp; 12,2704\\
17 &amp; A006034 &amp; 12 &amp; 11 &amp; 3 &amp; 1\,990\,523 &amp; 13,4053\\
18 &amp; A133857 &amp; 8 &amp; 7 &amp; 2 &amp; 1\,270\,141 &amp; 13,3615\\
19 &amp; A006035 &amp; 11 &amp; 10 &amp; 19 &amp; 209\,359 &amp; 9,3074\\
20 &amp; A127995 &amp; 9 &amp; 8 &amp; 3 &amp; 984\,349 &amp; 12,7011\\
 3lвсего &amp; \(M=218\) &amp; &amp; &amp; \(S=110{,}4423\)\\
 tabular
 table

Что смещено, а что нет

Употребительные оценки

Дабнер [dubner1993] и Бурделэ [bourdelais2009] характеризуют основание \(b\)
нормированной частотой встречаемости, получаемой подгонкой прямой к зависимости
\(\ln n_k\) от \(k\) с последующим делением на \(\ln b\). Согласно ожидаемый
наклон равен \(1/\lambda_b=\ln b/\kappa\), так что нормированная частота оценивает
\[\label{eq:G}
G_b=\frac{1}{\kappa},\qquad\text{ЛПВ:}\ \ G_b=\emg=0{,}5614595\ldots\]
В обращении несколько вариантов — обычный МНК со свободным членом, регрессия через
начало координат и концевая форма \(\hat G_b=D_b/(N_b\ln b)\), где \(D_b=t_{N_b}-t_0\).
Все они разделяют структурную особенность: интервал подгонки заканчивается на наибольшем
известном индексе.

Точное распределение

proposition[Условный закон правого конца]
Пусть события образуют однородный пуассоновский процесс интенсивности \(\lambda\) на
\((t_0,\infty)\), и пусть \(t_1&lt;\dots&lt;t_N\) — его первые \(N\) событий после \(t_0\).
Тогда \(D:=t_N-t_0\) имеет распределение \(\Gam(N,\lambda)\) с плотностью
\(\lambda^{N}d^{N-1}e^{-\lambda d}/(N-1)!\). При условии \(D=d\) предшествующие \(N-1\) событий
распределены как порядковые статистики \(N-1\) независимых равномерных величин на \((t_0,d)\).
 proposition

proof
Времена ожидания \(t_1-t_0,\dots,t_N-t_{N-1}\) независимы и распределены по закону
\(\mathrm{Exp}(\lambda)\), а сумма \(N\) таких величин распределена как \(\Gam(N,\lambda)\).
Условная равномерность есть свойство порядковых статистик пуассоновского процесса,
применённое к \((t_0,d)\).
 proof

corollary[Смещение обратной величины]
Оценка максимального правдоподобия для \(\lambda\) по одному лишь \(D\) равна
\(\hat\lambda=N/D\), причём
\[\label{eq:bias}
\mathbb E[\hat\lambda]=N\,\mathbb E[D^{-1}]=\frac{N}{N-1}\,\lambda,\]
так как \(\mathbb E[D^{-1}]=\lambda/(N-1)\) для \(D\sim\Gam(N,\lambda)\). Оценка
\(\tilde\lambda=(N-1)/D\) в точности несмещена.
 corollary

Чего из следствия
Естественно заключить, что раз \(\hat\lambda\) завышена в \(N/(N-1)\) раз, то частота
\(\hat G_b\) занижена во столько же. Это неверно.

proposition[Несмещённость частоты]
В условиях предложения :

[ (i)] концевая оценка несмещена точно:
\(\mathbb E\!\left[\dfrac{D}{N\ln b}\right]=\dfrac{1}{\lambda\ln b}=G_b\);
[ (ii)] наклон МНК регрессии \(t_k\) на \(k\) несмещён точно:
\(\mathbb E[\hat\beta]=1/\lambda\);
[ (iii)] следовательно, &lt;&lt;исправленная&gt;&gt; величина
\(\tilde G_b=\frac{N}{N-1}\hat G_b\) смещена вверх ровно в \(N/(N-1)\) раз.

proposition

proof
(i) \(\mathbb E[D]=N/\lambda\) для \(D\sim\Gam(N,\lambda)\), откуда результат немедленно.
(ii) Наклон МНК есть линейная статистика \(\hat\beta=\sum_k w_k t_k\) с весами
\(w_k=(k-\bar k)/\sum_j(j-\bar k)^2\), для которых \(\sum_k w_k=0\) и \(\sum_k w_k k=1\).
Поскольку \(\mathbb E[t_k]=t_0+k/\lambda\), получаем
\(\mathbb E[\hat\beta]=\sum_k w_k\,(t_0+k/\lambda)=1/\lambda\).
(iii) непосредственно из (i).
 proof

Содержательный смысл прост: несмещённые оценки \(\kappa\) и \(1/\kappa\) не могут быть
взаимно обратными, поскольку \(x\mapsto1/x\) строго выпукло. Несмещённая пара — это
\((\hat G_b,\ \tilde\kappa_b)\), где \(\tilde\kappa_b=(N_b-1)\ln b/D_b\); но
\(\tilde\kappa_b\ne1/\hat G_b\). Всякая единая &lt;&lt;поправка на цензурирование&gt;&gt;,
исправляющая одну величину, портит другую. Таблица подтверждает
предложение симуляцией.

table[t]
 Проверка предложений методом Монте-Карло, \(200\,000\) реализаций на строку
(зерно генератора фиксировано, см.\ analysis.py).
Целевое значение всех столбцов, кроме второго, равно \(1{,}0000\).
 Monte Carlo check of the propositions, \(200\,000\) replications per row
(generator seed fixed, see analysis.py). The target value of every column
except the second is \(1.0000\).

tabularrrrrrrr
 \(N\) &amp; \(\mathbb E[\hat\lambda]/\lambda\) &amp; \(N/(N-1)\) &amp; \(\mathbb E[\tilde\lambda]/\lambda\)
&amp; \(\mathbb E[\hat G]\lambda\) &amp; \(\mathbb E[\tilde G]\lambda\) &amp; \(\mathbb E[\hat\beta]\lambda\)\\
 7 &amp; 1,1665 &amp; 1,1667 &amp; 0,9998 &amp; 1,0002 &amp; 1,1669 &amp; 1,0002\\
10 &amp; 1,1115 &amp; 1,1111 &amp; 1,0004 &amp; 0,9998 &amp; 1,1109 &amp; 0,9997\\
16 &amp; 1,0672 &amp; 1,0667 &amp; 1,0005 &amp; 0,9994 &amp; 1,0660 &amp; 0,9994\\
22 &amp; 1,0481 &amp; 1,0476 &amp; 1,0004 &amp; 0,9996 &amp; 1,0472 &amp; 0,9997\\
51 &amp; 1,0202 &amp; 1,0200 &amp; 1,0002 &amp; 0,9999 &amp; 1,0199 &amp; 0,9998\\
 tabular
 table

remark
Отрицательный результат этого параграфа стоит подчеркнуть, поскольку он противоречит
интуиции: систематическое отклонение опубликованных частот вниз от \(\emg\)
не объясняется схемой подгонки. Его источник — либо реальное превышение
\(\kappa\) над \(\eg\), либо, как показывает , схема наблюдения,
но не арифметика оценки.
 remark

Неустойчивость к выбору формы оценки

Несмещённость не означает согласованности. В таблице приведены
концевая форма \(\hat G_b\) и оценка по МНК \(\hat G_b^{\mathrm{OLS}}\) на одних и тех же
данных. Расхождения достигают \(29{,}5\%\) (\(b=18\)), \(15{,}9\%\) (\(b=13\)) и \(10{,}3\%\)
(\(b=11\)).

Сопоставим их с тем, что в литературе толкуют содержательно, — с отклонениями
самих оценок от \(\emg\). Последние по пятнадцати основаниям имеют медиану \(17{,}6\%\)
(от \(5{,}6\%\) при \(b=20\) до \(43{,}7\%\) при \(b=19\)). Наибольшее расхождение форм,
\(29{,}5\%\), превышает эту медиану в \(1{,}7\) раза. В среднем выбор формы, разумеется,
дешевле: медиана расхождений равна \(4{,}1\%\), то есть около четверти медианного
отклонения. Но у двух оснований из пятнадцати (\(b=18\) и \(b=13\)) выбор формы весит
больше, чем всё их отклонение от предсказания ЛПВ, — и именно эти основания
фольклор и обсуждает.

Следствие для фольклора прямое. Основание 18 при концевой форме имеет
\(\hat G_{18}=0{,}6604\) — третье по величине из пятнадцати (после \(b=7\) с \(0{,}7104\)
и \(b=10\) с \(0{,}6612\)), то есть уверенно входит в тройку &lt;&lt;самых неудачливых&gt;&gt;; при МНК
\(\hat G_{18}^{\mathrm{OLS}}=0{,}4656\) — десятое место из пятнадцати, ниже медианы
\(0{,}4904\), то есть оно уже &lt;&lt;удачливое&gt;&gt;. Ярлык переворачивается без единого нового
простого числа, от одной лишь смены формы оценки: основание перемещается с третьего
места на десятое.

К этому добавляется вторая, техническая беда МНК: его стандартные ошибки в этой задаче
неверны. Остатки суть отклонения порядковых статистик и сильно автокоррелированы;
для \(b=2\) мы получаем \(\rho_1=0{,}825\), а ковариационная оценка Ньюи — Уэста с восемью
лагами увеличивает стандартную ошибку свободного члена с \(0{,}447\) до \(0{,}732\)
( ). Опубликованные точечные значения не сопровождаются интервалами,
и это, а не смещение, — главная методологическая претензия к текущей практике.

Условное правдоподобие

Предложение даёт больше, чем разбор смещения. Полагая \(t_0=\ln n_{\min}\)
и приняв \((N_b,D_b)\) за данные по основанию \(b\), получаем логарифмическое правдоподобие
\[\label{eq:loglik}
\ell(\kappa)=\sum_b\Bigl[N_b\ln\frac{\kappa}{\ln b}-\frac{\kappa}{\ln b}D_b\Bigr]+\mathrm{const},\]
распределение которого не зависит от границы поиска \(L_b\). Это существенно практически:
\(L_b\) хорошо документирована лишь при \(b=2\). Дифференцируя и полагая
\(S=\sum_b D_b/\ln b\), получаем
\[\label{eq:mle}
\hat\kappa=\frac{M}{S},\qquad \tilde\kappa=\frac{M-1}{S},\qquad M=\sum_b N_b .\]
Так как \(\kappa S=\sum_b\lambda_bD_b\) есть сумма независимых величин \(\Gam(N_b,1)\), то
\[\label{eq:pivot}
\kappa S\sim\Gam(M,1),\]
то есть точная центральная статистика; доверительные интервалы и \(p\)-значения получаются
в замкнутой форме. Ровно это утверждение и требует ревизии — см. .

remark[Независимость по основаниям]
Объединение предполагает независимость процессов по разным основаниям. Строго она не
выполняется на малых индексах: семнадцать значений индекса встречаются более чем в одном
основании, причём \(n=3\) — в девяти, поскольку \(\Rb(3)=b^2+b+1\) просто для многих \(b\).
Все такие совпадения лежат при \(n\le317\). Существеннее, впрочем, не совпадение индексов
(числа \(\Rb(n)\) при разных \(b\) различны), а возможная общность алгебраических делителей;
и то и другое затрагивает лишь малые \(n\), тогда как \(D_b\) определяется верхним концом
диапазона. Раздел подтверждает, что отбрасывание всех индексов ниже \(10^3\)
вывод не меняет.
 remark

Две схемы наблюдения

В чём различие

Пивот выведен в предположении, что \(N_b\) задано планом наблюдения:
мы смотрим на процесс, пока не наберём \(N_b\) событий, и останавливаемся. Назовём это
схемой A (обратная выборка, цензурирование типа II).

Данные получены иначе. Для каждого основания вычислительный поиск покрыл интервал
\((t_0,\ln L_b]\) целиком, и найденными оказались все события, попавшие внутрь; число
находок \(N_b\) — случайная величина, а фиксирован фронт \(L_b\). Назовём это
схемой B.

remark[Что здесь классика, а что нет]
Само различие схем классическое и восходит к теории надёжности, где схема A
называется failure-truncated, а схема B — time-truncated
испытанием на долговечность [epstein1954trunc,epsteinsobel1954]. Оценка
\((N-1)/D\), несмещённая при схеме A (следствие ), там
учебниковая, и мы не претендуем на неё. Более того, при схеме B точно
несмещённой оценки среднего не существует [bartholomew1963,basu1964]:
экспоненциально малый остаток в не небрежность, а лучшее, что
здесь достижимо в принципе.

Новым мы считаем другое. В классической постановке момент прекращения
испытания известен: время \(T\) назначает экспериментатор. Здесь фронт
\(L_b\) не документирован ни для одного основания, кроме \(b=2\), поэтому полную
экспозицию приходится не брать из протокола, а восстанавливать — через
отсутствие последействия, из самих находок. Отсюда и берётся поправка
на каждое основание, а не на выборку в целом: неизвестных фронтов
столько же, сколько оснований. Обзор смещений, порождаемых краем окна
наблюдения, но в непараметрической постановке и для формы распределения
интервалов, а не для интенсивности, дан в [kivela2015].
 remark

Различие не косметическое. При схеме B, условно на \(N_b=n\), положения событий суть
\(n\) независимых равномерных величин на \((t_0,\ln L_b]\), поэтому условное распределение
\(D_b\) зависит от \(L_b\) и не зависит от \(\lambda_b\): при фиксированном \(N_b\)
величина \(D_b\) информативна о фронте, а не об интенсивности. Правдоподобие 
при схеме B не является правдоподобием.

Заметим также, что настоящей работы, где для \(b=2\) фронт известен
и используется явно, построен именно на схеме B. Обе схемы в одной работе применять
нельзя; ниже мы принимаем схему B как соответствующую способу получения данных
и калибруем под неё результаты схемы A.

Правильная объединённая оценка при схеме B

Смещение имеет замкнутую форму, и она поучительна.

proposition
Пусть при схеме B поиск по основанию \(b\) покрыл \((t_0,\ln L_b]\), ширина окна есть
\(W_b=\ln L_b-t_0\), а \(\delta_b=\ln L_b-t_{N_b}\) — расстояние от фронта до последнего
найденного события (при \(N_b=0\) полагаем \(\delta_b=W_b\)). Тогда
\[\label{eq:delta}
\Pr(\delta_b&gt;x)=e^{-\lambda_b x}\ \ (0\le x&lt;W_b),\qquad
\Pr(\delta_b=W_b)=e^{-\lambda_b W_b},\]
то есть \(\delta_b\) есть экспоненциальная величина с параметром \(\lambda_b\),
усечённая на \(W_b\), и
\[\label{eq:Edelta}
\mathbb E[\delta_b]=\frac{1-e^{-\lambda_b W_b}}{\lambda_b}.\]
Полная экспозиция есть \(S_{\mathrm{full}}=S+\sum_b\delta_b/\ln b=\sum_b W_b/\ln b\),
причём \(\mathbb E[M]=\kappa S_{\mathrm{full}}\) тождественно, а
\[\label{eq:EBd}
\mathbb E\Bigl[\kappa\sum_b\delta_b/\ln b\Bigr]=B-\sum_b e^{-\lambda_b W_b}.\]
Приравнивая \(\kappa S_{\mathrm{full}}\) к \(M\) и отбрасывая экспоненциально малый
остаток, получаем моментную оценку
\[\label{eq:MBS}
\hat\kappa_{\mathrm B}=\frac{M-B}{S}.\]
 proposition

proof
Событие \(\{\delta_b&gt;x\}\) при \(x&lt;W_b\) означает, что на интервале
\((\ln L_b-x,\ln L_b]\) длины \(x\) нет ни одного события процесса; вероятность этого
равна \(e^{-\lambda_b x}\). При \(x\to W_b^-\) остаётся случай &lt;&lt;событий нет вовсе&gt;&gt;,
что и даёт атом в . Интегрируя хвост,
\(\mathbb E[\delta_b]=\int_0^{W_b}e^{-\lambda_b x}\,dx=(1-e^{-\lambda_b W_b})/\lambda_b\),
откуда . Далее, \(S_{\mathrm{full}}\) не случайна: по построению
\(D_b+\delta_b=W_b\), поэтому \(\kappa S_{\mathrm{full}}=\sum_b\lambda_b W_b=\mathbb E[M]\)
— это в точности уравнение моментов. Наконец,
\(\kappa\,\mathbb E[\delta_b]/\ln b=\lambda_b\mathbb E[\delta_b]=1-e^{-\lambda_b W_b}\),
и суммирование по \(b\) даёт .
 proof

remark
Отбрасываемый в остаток \(\sum_b e^{-\lambda_b W_b}\) есть ожидаемое
число оснований, у которых поиск не дал ни одной находки. В наших данных находки есть
у всех, а \(\lambda_b W_b\approx N_b\ge7\), так что остаток не превосходит
\(\sum_b e^{-N_b}&lt;3\cdot10^{-3}\) против \(B=15\) — относительная поправка порядка
\(0{,}02\%\). Именно её и показывает первая строка таблицы .
Подчеркнём, что без этого усечения утверждение \(\delta_b\sim\mathrm{Exp}
(\lambda_b)\) было бы неверным: у процесса нет событий левее \(t_0\), поэтому
\(\delta_b\le W_b\) по построению, и ссылка на отсутствие последействия здесь
недостаточна.
 remark

Иными словами, условное правдоподобие стоит информации, эквивалентной одному событию
на каждое основание, — а формула вычитает одно событие
всего. При \(B=15\) разница составляет четырнадцать событий, то есть \(7\%\):
\[\frac{M-1}{S}=1{,}9648\qquad\text{против}\qquad\frac{M-B}{S}=1{,}8381 .\]
Прямая симуляция схемы B подтверждает: оценка имеет смещение \(+0{,}02\%\),
тогда как \((M-1)/S\) — смещение \(+6{,}9\%\) (таблица ).

Существенно, что вывод предложения опирается только на
равенство , которое верно для любого положения фронта:
в него входит лишь ширина окна \(W_b\), а она сокращается вместе с
экспоненциально малым остатком (замечание ). Поэтому
оценка не содержит свободного параметра и не требует знания того,
насколько далеко ушёл фронт. Таблица подтверждает это симуляцией
при семи различных правилах расположения фронта, включая случайные и различные по
основаниям.

table[t]
 Несмещённость двух объединённых оценок при различном расположении фронта.
Истинное значение \(\eg=1{,}7811\); \(15\,000\) реализаций на строку.
Правила заданы через ширину окна \(W_b=\ln L_b-t_0\): &lt;&lt;\(\mathbb E[\#]\) = наблюдённое&gt;&gt;
есть \(W_b=N_b/\lambda_b\); &lt;&lt;\(+s\) средних интервалов&gt;&gt; — \(W_b=(N_b+s)/\lambda_b\);
&lt;&lt;в \(c\) раз дальше по \(t\)&gt;&gt; — \(W_b=c\,D_b\) с наблюдённым \(D_b\); &lt;&lt;случайные&gt;&gt; —
\(W_b=(N_b/\lambda_b)\,U\) с независимой \(U\sim\mathrm{Unif}(0{,}7;\,1{,}8)\), своей
у каждого основания и каждой реализации.
 Unbiasedness of the two pooled estimators under different frontier
placements. True value \(\eg=1.7811\); \(15\,000\) replications per row. The rules are
stated through the window width \(W_b=\ln L_b-t_0\): «\(\mathbb E[\#]\) = observed» is
\(W_b=N_b/\lambda_b\); «\(+s\) mean intervals» is \(W_b=(N_b+s)/\lambda_b\); «\(c\) times
further in \(t\)» is \(W_b=c\,D_b\) with the observed \(D_b\); «random» is
\(W_b=(N_b/\lambda_b)\,U\) with independent \(U\sim\mathrm{Unif}(0.7,\,1.8)\), drawn
separately for each base and each replication.

tabularlrrrr
 Правило для фронта &amp; \(\mathbb E[(M{-}B)/S]\) &amp; откл. &amp; \(\mathbb E[(M{-}1)/S]\) &amp; откл.\\
 \(\mathbb E[\#\text{событий}]\) = наблюдённое &amp; 1,7814 &amp; \(+0{,}02\%\) &amp; 1,9043 &amp; \(+6{,}92\%\)\\
фронт \(+0{,}5\) среднего интервала &amp; 1,7816 &amp; \(+0{,}03\%\) &amp; 1,9001 &amp; \(+6{,}68\%\)\\
фронт \(+2\) средних интервала &amp; 1,7820 &amp; \(+0{,}05\%\) &amp; 1,8891 &amp; \(+6{,}07\%\)\\
фронт \(+5\) средних интервалов &amp; 1,7820 &amp; \(+0{,}05\%\) &amp; 1,8717 &amp; \(+5{,}09\%\)\\
фронт в \(1{,}5\) раза дальше по \(t\) &amp; 1,7825 &amp; \(+0{,}08\%\) &amp; 1,8716 &amp; \(+5{,}08\%\)\\
фронт вдвое дальше по \(t\) &amp; 1,7816 &amp; \(+0{,}03\%\) &amp; 1,8475 &amp; \(+3{,}73\%\)\\
фронты случайные, разные по основаниям &amp; 1,7812 &amp; \(+0{,}01\%\) &amp; 1,8788 &amp; \(+5{,}49\%\)\\
 tabular
 table

Единственное допущение. Требуется лишь следующее.

(A1) Положение фронта \(L_b\) не выбиралось по результатам поиска:
вычислительный бюджет, а не находки, определяет, до какого \(n\) доведено просеивание.

Если (A1) нарушено в крайней форме — поиск по каждому основанию прекращался
сразу после находки, — то \(\delta_b=0\) и мы возвращаемся к схеме A. Общий вид оценки
при \(\delta_b=m/\lambda_b\) есть \(\hat\kappa=(M-Bm)/S\), так что весь диапазон,
порождаемый неопределённостью в (A1), есть отрезок между \(1{,}838\) (\(m=1\), фронт
независим от находок) и \(1{,}974\) (\(m=0\), поиск останавливается на находке). (
При \(m=0\) моментное приравнивание даёт ровно \(M/S=1{,}9739\), тогда как точная
несмещённая оценка схемы A из следствия есть \((M-1)/S=1{,}9648\)
(различие — одно событие из \(218\), то есть \(0{,}5\%\); это обычная разница между
моментной оценкой и оценкой, исправленной по Йенсену). В и всюду
далее мы приводим \((M-1)/S\); здесь для однородности семейства \((M-Bm)/S\) выписан
предел моментной формы.)
Реальная практика распределённых вычислений явно ближе к первому: просеивание ведётся
сплошными интервалами, а находки объявляются по ходу. Существенно, что оба конца
отрезка совместимы с ЛПВ ( ), так что вывод работы от (A1) не зависит;
от (A1) зависит лишь величина остаточного разрыва.

table[t]
 Калибровка пивота при схеме B. &lt;&lt;Сдвиг фронта&gt;&gt; — на сколько
средних интервалов \(\ln L_b\) отнесён дальше ожидаемого последнего события.
\(20\,000\) реализаций на строку; точность Монте-Карло около \(\pm0{,}005\)
(биномиальная при наблюдаемом уровне \(0{,}16\); разброс по пяти зёрнам
генератора — \(0{,}162\)–\(0{,}169\)).
 Calibration of pivot under scheme B. «Frontier shift»
is how many mean intervals beyond the expected last event \(\ln L_b\) is placed.
\(20\,000\) replications per row; Monte Carlo accuracy about \(\pm0.005\) (binomial at
the observed level \(0.16\); the spread across five generator seeds is
\(0.162\)–\(0.169\)).

tabularlrr
 Схема &amp; ошибка I рода (номинал \(0{,}05\)) &amp; \(\mathbb E[\tilde\kappa]/\kappa=c\)\\
 B, сдвиг \(0\) &amp; 0,1616 &amp; 1,0688\\
B, сдвиг \(0{,}5\) &amp; 0,1600 &amp; 1,0664\\
B, сдвиг \(1\) &amp; 0,1558 &amp; 1,0641\\
B, сдвиг \(2\) &amp; 0,1491 &amp; 1,0595\\
A (контроль) &amp; 0,0504 &amp; 0,9997\\
 tabular
 table

Два вывода из таблицы . Во-первых, номинальный \(5\%\) критерий при
схеме B отвергает верную гипотезу в \(16{,}2\%\) случаев: заявленная точность интервалов
завышена примерно втрое. Во-вторых, оценка при схеме B практически
несмещена, так что дело не в неустранимом искажении, а в неверно выбранной схеме.

Единственная прямая проверка возможна для \(b=2\): там
\(\delta_2=\ln(X_{\mathrm{ver}}/n_{\max})=0{,}056\) при среднем интервале
\(\ln 2/\eg=0{,}389\), предсказанном ЛПВ.
Это одна реализация экспоненциальной величины с единичным средним, и такое значение
не редкость: \(\Pr(\delta\lambda&lt;0{,}143)=0{,}13\). (Если брать не предсказанный,
а оценённый средний интервал \(1/\hat\lambda=0{,}358\), то \(\delta\lambda=0{,}155\)
и \(\Pr=0{,}14\); вывод тот же.) Отметим, что несмещённость
оценки от этой реализации не зависит — она усредняет по всем
пятнадцати основаниям, — а сама изменчивость \(\delta_b\) учтена в доверительном
интервале , полученном инверсией симуляции схемы B.

Данные не выбирают схему за нас

Подчеркнём, что \((M-1)/S\) и \((M-B)/S\) — функции одних и тех же достаточных статистик
\((N_b,D_b)\). Никакая обработка имеющихся данных не скажет, какая из них верна: выбор
определяется тем, как данные собирались, и цена его составляет \(7\%\) — вдвое больше,
чем весь остаточный разрыв с ЛПВ.

Естественная попытка обойти выбор — строить объединённую оценку из заведомо
несмещённых кусков.
Оценка по одному основанию \(\tilde\kappa_b=(N_b-1)\ln b/D_b\) несмещена при схеме A
(следствие ) и несмещена при схеме B с точностью до экспоненциально
малого члена. Действительно, при \(N_b=n\ge2\) отношение \(D_b/W_b\) распределено как
\(\mathrm{Beta}(n,1)\), и тождество
\(\mathbb E[1/\mathrm{Beta}(\alpha,\beta)]=(\alpha+\beta-1)/(\alpha-1)\) даёт
\(\mathbb E[\tilde\lambda_b\mid N_b=n]=n/W_b\); при \(n\in\{0,1\}\) оценка равна нулю.
Усреднение по \(n\sim\mathrm{Pois}(\lambda_bW_b)\) поэтому даёт не \(\lambda_b\), а
\[\mathbb E[\tilde\lambda_b]=\lambda_b-\frac{\Pr(N_b=1)}{W_b}
 =\lambda_b\Bigl(1-e^{-\lambda_bW_b}\Bigr),\]
то есть тот же экспоненциально малый дефицит, что и в : при
\(\lambda_bW_b\approx N_b\ge7\) он не превосходит \(0{,}1\%\). Симуляция подтверждает: по каждому из пятнадцати оснований среднее
\(\tilde\kappa_b\) лежит в пределах \(1{,}774\)–\(1{,}790\) при истинном \(1{,}781\)
(оценка имеет бесконечную дисперсию при \(N_b=2\), поэтому выборочное среднее
сходится медленно; остаточный разброс по основаниям — шум Монте-Карло).

Тем не менее взвешенное среднее
\[\kappa_\ast=\sum\nolimits_b(N_b-2)\tilde\kappa_b\Big/\sum\nolimits_b(N_b-2)\]
с обратно-дисперсионными весами даёт при схеме A смещение \(+0{,}05\%\),
а при схеме B — \(+7{,}51\%\), то есть практически то же, что и \((M-1)/S\). Причина в том, что веса — сами числа событий —
при схеме B случайны и положительно коррелируют с оценками; несмещённость каждого
слагаемого не переносится на отношение сумм.

Отсюда мы делаем узкий, но, как нам кажется, важный вывод: выигрыш в точности от
объединения оснований неотделим от предположения о схеме наблюдения.
Единственный радикальный выход — документировать фронты поиска \(L_b\), как это делает
GIMPS для \(b=2\). Мы обращаемся с этим к участникам соответствующих поисковых проектов.

Результаты

Оценки по основаниям

table[t]
 Оценки по основаниям. \(\hat G_b=D_b/(N_b\ln b)\) — концевая форма;
\(\hat G_b^{\mathrm{OLS}}\) — наклон МНК \(\ln n_k\) на \(k\), делённый на \(\ln b\); обе
несмещены (предложение ). \(\tilde\kappa_b=(N_b-1)\ln b/D_b\) —
несмещённая оценка константы, ДИ точный из \(\Gam(N_b,1)\). Последний столбец —
вероятностное интегральное преобразование \(\Gam(N_b,1)\), применённое к
\(\eg D_b/\ln b\). ЛПВ предсказывает \(G=\emg=0{,}5615\) и \(\kappa=\eg=1{,}7811\).
 Per-base estimates. \(\hat G_b=D_b/(N_b\ln b)\) is the endpoint form;
\(\hat G_b^{\mathrm{OLS}}\) is the OLS slope of \(\ln n_k\) on \(k\) divided by \(\ln b\);
both are unbiased (Proposition ). \(\tilde\kappa_b=(N_b-1)\ln b/D_b\)
is the unbiased estimator of the constant, with an exact interval from \(\Gam(N_b,1)\).
The last column is the probability integral transform of \(\Gam(N_b,1)\) applied to
\(\eg D_b/\ln b\). LPW predicts \(G=\emg=0.5615\) and \(\kappa=\eg=1.7811\).

tabularrrrrrrrl r
 \(b\) &amp; \(N_b\) &amp; \(\hat G_b\) &amp; \(\hat G_b^{\mathrm{OLS}}\) &amp; разн., % &amp;
\(\hat\kappa_b\) &amp; \(\tilde\kappa_b\) &amp; 95% ДИ &amp; PIT\\
 2 &amp; 51 &amp; 0,5102 &amp; 0,5309 &amp; \(+4{,}1\) &amp; 1,960 &amp; 1,921 &amp; [1,459; 2,533] &amp; 0,266\\
3 &amp; 22 &amp; 0,6148 &amp; 0,6081 &amp; \(-1{,}1\) &amp; 1,626 &amp; 1,552 &amp; [1,019; 2,373] &amp; 0,693\\
5 &amp; 18 &amp; 0,4802 &amp; 0,4666 &amp; \(-2{,}8\) &amp; 2,083 &amp; 1,967 &amp; [1,234; 3,149] &amp; 0,285\\
6 &amp; 16 &amp; 0,5000 &amp; 0,4904 &amp; \(-1{,}9\) &amp; 2,000 &amp; 1,875 &amp; [1,143; 3,092] &amp; 0,355\\
7 &amp; 9 &amp; 0,7104 &amp; 0,7371 &amp; \(+3{,}8\) &amp; 1,408 &amp; 1,251 &amp; [0,644; 2,466] &amp; 0,801\\
10 &amp; 10 &amp; 0,6612 &amp; 0,6746 &amp; \(+2{,}0\) &amp; 1,512 &amp; 1,361 &amp; [0,725; 2,584] &amp; 0,737\\
11 &amp; 12 &amp; 0,4034 &amp; 0,3617 &amp; \(-10{,}3\) &amp; 2,479 &amp; 2,272 &amp; [1,281; 4,066] &amp; 0,162\\
12 &amp; 13 &amp; 0,3981 &amp; 0,3796 &amp; \(-4{,}7\) &amp; 2,512 &amp; 2,319 &amp; [1,337; 4,050] &amp; 0,141\\
13 &amp; 12 &amp; 0,4098 &amp; 0,3448 &amp; \(-15{,}9\) &amp; 2,440 &amp; 2,237 &amp; [1,261; 4,002] &amp; 0,174\\
14 &amp; 10 &amp; 0,5025 &amp; 0,5386 &amp; \(+7{,}2\) &amp; 1,990 &amp; 1,791 &amp; [0,954; 3,400] &amp; 0,406\\
15 &amp; 9 &amp; 0,5035 &amp; 0,5054 &amp; \(+0{,}4\) &amp; 1,986 &amp; 1,766 &amp; [0,908; 3,479] &amp; 0,417\\
17 &amp; 11 &amp; 0,4301 &amp; 0,4353 &amp; \(+1{,}2\) &amp; 2,325 &amp; 2,114 &amp; [1,161; 3,887] &amp; 0,229\\
18 &amp; 7 &amp; 0,6604 &amp; 0,4656 &amp; \(-29{,}5\) &amp; 1,514 &amp; 1,298 &amp; [0,609; 2,825] &amp; 0,714\\
19 &amp; 10 &amp; 0,3161 &amp; 0,2971 &amp; \(-6{,}0\) &amp; 3,164 &amp; 2,847 &amp; [1,517; 5,405] &amp; 0,061\\
20 &amp; 8 &amp; 0,5300 &amp; 0,5713 &amp; \(+7{,}8\) &amp; 1,887 &amp; 1,651 &amp; [0,815; 3,402] &amp; 0,483\\
 tabular
 table

Ниже \(\emg\) лежат \(11\) оснований из \(15\) — одинаково при обеих формах оценки, так что
знак отклонения устойчив к её выбору, в отличие от порядка оснований между собой.
Все пятнадцать PIT-квантилей лежат внутри центральной \(95\%\) области; крайние — \(b=19\)
на квантиле \(0{,}061\) и \(b=7\) на \(0{,}801\). Основание 13, &lt;&lt;удачливое&gt;&gt;, находится на
\(0{,}174\), что ничем не примечательно для одного из пятнадцати.

Объединённая оценка

При схеме A формулы – дают
\[\label{eq:resA}
\tilde\kappa=1{,}9648,\qquad 95\%\ \text{ДИ}=[1{,}7205;\,2{,}2444],\qquad p=0{,}142 .\]
Точечная оценка на \(10\%\) выше \(\eg\), и именно это превышение прежде интерпретировалось
как след опущенного эвристикой фактора.

Оценка для схемы B даёт (интервал и \(p\)-значение получены инверсией
симуляции схемы B: для сетки значений \(\kappa\) симулируется схема B с наблюдённым
расположением фронта и отыскиваются те \(\kappa\), при которых наблюдённая статистика
\((M-B)/S\) попадает на квантили \(0{,}025\) и \(0{,}975\) симулированного распределения;
\(20\,000\) реализаций на точку)
\[\label{eq:resB}
\hat\kappa_{\mathrm B}=\frac{M-B}{S}=1{,}8381,\qquad
95\%\ \text{ДИ}=[1{,}613;\,2{,}130],\qquad p=0{,}639 .\]
Превышение сокращается с \(10{,}3\%\) до \(3{,}2\%\), а \(p\)-значение — с \(0{,}14\) до
\(0{,}64\). Мы полагаем, что схема B ближе к способу получения данных, и потому
считаем основным результатом, а — верхней границей:
она отвечает предположению \(m=0\), то есть остановке поиска ровно на находке.
Истина лежит между ними, и без публикации \(L_b\) сузить этот промежуток нельзя.
Обе оценки согласуются с ЛПВ; различаются они тем, требуют ли данные объяснения
для остаточного превышения. Мы заключаем, что не требуют. Картина в целом показана
на рис. : доверительный интервал каждого основания накрывает
и \(\eg\), и обе объединённые оценки.

figure[t]
 Оценки \(\tilde\kappa_b\) по основаниям с точными \(95\%\) доверительными
интервалами из \(\Gam(N_b,1)\); площадь маркера пропорциональна \(N_b\). Штриховая линия —
значение ЛПВ \(\eg\); синяя — объединённая оценка при схеме A; зелёная с полосой —
калиброванная на схему B оценка и её интервал. Каждое основание по отдельности
совместимо с универсальной константой.
 Per-base estimates \(\tilde\kappa_b\) with exact \(95\%\) confidence
intervals from \(\Gam(N_b,1)\); marker area is proportional to \(N_b\). Dashed line: the
LPW value \(\eg\); blue dash-dotted: the pooled estimate under scheme A; green with a
hatched band: the estimate calibrated to scheme B and its interval. Each base
separately is compatible with a universal constant.

figure

Однородность и её мощность

Пусть \(H_0\) — модель с единой \(\kappa\), а \(H_1\) — модель со свободными \(\kappa_b\).
Из , поскольку \(\sum_b\hat\kappa_bD_b/\ln b=M=\hat\kappa S\), статистика
отношения правдоподобий сводится к
\[\Lambda=2\sum_b N_b\ln\frac{\hat\kappa_b}{\hat\kappa}\ \overset{H_0}{\sim}\ \chi^2_{B-1}.\]
Мы получаем \(\Lambda=7{,}40\) при \(14\) степенях свободы, \(p=0{,}92\).

Однако неотвержение информативно ровно настолько, насколько мощен критерий, и здесь
следует применить к себе то же требование, что и к литературе. Мы симулировали
альтернативы, в которых \(\kappa_b\) логнормально рассеяны вокруг \(\eg\) с коэффициентом
вариации \(cv\):

center
 tabularlrrrrrrrrr
 \(cv\) &amp; 0,05 &amp; 0,10 &amp; 0,15 &amp; 0,20 &amp; 0,25 &amp; 0,30 &amp; 0,35 &amp; 0,40 &amp; 0,50\\
мощность &amp; 0,061 &amp; 0,120 &amp; 0,212 &amp; 0,363 &amp; 0,535 &amp; 0,693 &amp; 0,817 &amp; 0,893 &amp; 0,965\\
 tabular
 center

Мощности \(80\%\) критерий достигает лишь при \(cv\approx0{,}34\) (\(5000\) реализаций
на точку сетки, точность по мощности около \(\pm0{,}01\)). Следовательно,
\(p=0{,}92\) означает: данные не требуют базозависимых частот, но и не исключают
разброса \(\kappa_b\) величиной до трети от значения константы. Утверждение
&lt;&lt;удачливых оснований не существует&gt;&gt; из имеющихся данных не следует; следует более
слабое — &lt;&lt;их существование данными не поддерживается, а различия менее \(\pm34\%\)
принципиально неразличимы&gt;&gt;.

Устойчивость

Нижнее усечение. Мы варьировали нижнюю точку усечения, чтобы прощупать
асимптотический режим (эвристика асимптотична, тогда как модель
постоянной интенсивности стартует от \(n=2\)). Результаты в таблице .
Оценка схемы A растёт с \(1{,}965\) до \(2{,}099\) — не строго монотонно (при
\(n&gt;10^{2}\) она отступает с \(2{,}019\) до \(2{,}012\)), но систематически: рост
составляет \(6{,}8\%\) при том, что все пять значений получены на вложенных
подвыборках одних и тех же данных. Это тренд, а не шум. Оценка схемы B тренда не показывает и колеблется вокруг \(\eg\)
в пределах \(1{,}79\)–\(1{,}87\) (при более слабом критерии выбытия \(N_b\ge1\) —
в пределах \(1{,}76\)–\(1{,}87\), по-прежнему без тренда). Причина видна
из : усечение уменьшает \(M\), но не \(B\), тогда как схема A вычитает
единицу независимо от объёма выборки. Мы считаем это независимым подтверждением
диагноза : тренд был свойством оценки, а не данных.
Обе кривые приведены на рис. .

table[t]
 Устойчивость к нижнему усечению. Основание остаётся в выборке, если после
усечения у него сохраняется не менее двух событий (\(N_b\ge2\)); при \(n&gt;10^4\) этому
критерию перестаёт удовлетворять основание 19, откуда \(B=14\). Критерий существен:
при более слабом требовании \(N_b\ge1\) основание 19 сохраняется, и последняя строка
принимает вид \(B=15\), \(M=90\), \((M-1)/S=2{,}0848\), \((M-B)/S=1{,}7569\), \(p=0{,}128\).
 Robustness to lower truncation. A base is retained if at least
two events survive the truncation (\(N_b\ge2\)); at \(n&gt;10^4\) base 19 no longer
meets this criterion, whence \(B=14\). The criterion matters: under the weaker
requirement \(N_b\ge1\) base 19 is retained and the last row becomes \(B=15\), \(M=90\),
\((M-1)/S=2.0848\), \((M-B)/S=1.7569\), \(p=0.128\).

tabularlrrrrr
 усечение &amp; \(B\) &amp; \(M\) &amp; \((M-1)/S\) &amp; \((M-B)/S\) &amp; \(p\) (схема A)\\
 нет &amp; 15 &amp; 218 &amp; 1,9648 &amp; 1,8381 &amp; 0,142\\
\(n&gt;10\) &amp; 15 &amp; 192 &amp; 2,0192 &amp; 1,8712 &amp; 0,080\\
\(n&gt;10^2\) &amp; 15 &amp; 156 &amp; 2,0116 &amp; 1,8299 &amp; 0,124\\
\(n&gt;10^3\) &amp; 15 &amp; 125 &amp; 2,0551 &amp; 1,8231 &amp; 0,106\\
\(n&gt;10^4\) &amp; 14 &amp; 89 &amp; 2,0990 &amp; 1,7889 &amp; 0,116\\
 tabular
 table

figure[t]
 Объединённая оценка при нижнем усечении: \((M-1)/S\) (схема A) и \((M-B)/S\)
(схема B). Тренд оценки схемы A при переходе к схеме B исчезает.
 The pooled estimate under lower truncation: \((M-1)/S\) (scheme A) and
\((M-B)/S\) (scheme B). The trend of the scheme A estimate disappears under scheme B.

figure

Исключение по одному основанию. Анализ с исключением одного основания даёт
\(\tilde\kappa\) в пределах \([1{,}930;\,2{,}012]\) и \(p\) от \(0{,}086\) до \(0{,}237\);
ни одно основание не определяет вывод, а наиболее влиятельное, \(b=3\), при удалении
сдвигает \(p\) лишь до \(0{,}086\).

Статус данных. Ограничение основания 2 пятьюдесятью дважды проверенными
показателями переводит результат с \(\tilde\kappa=1{,}965\), \(p=0{,}142\) на
\(\tilde\kappa=1{,}961\), \(p=0{,}151\). Исключение всех индексов \(n&gt;10^6\), где статус
элементов — PRP, даёт \(\tilde\kappa=1{,}951\) при \(M=182\). В наихудшем сценарии, когда
последний известный PRP какого-либо основания оказывается составным, наибольший сдвиг
даёт \(b=17\): \(\tilde\kappa=1{,}977\). Все варианты лежат внутри интервала ,
поэтому возможные псевдопростые на вывод не влияют.

Статистическая мощность

Согласно мощность против истинной константы \(\kappa=r\eg\) на уровне
\(\alpha\) доступна в замкнутой форме (таблица ).

table[t]
 Мощность на уровне \(\alpha=0{,}05\) для отвержения \(\kappa=\eg\), когда истинная
константа превышает его в указанное число раз.
 Power at level \(\alpha=0.05\) for rejecting \(\kappa=\eg\) when the true
constant exceeds it by the stated factor.

tabularlrr
 \(\kappa/\eg\) &amp; только Мерсенн (\(M=51\)) &amp; объединение (\(M=218\))\\
 1,05 &amp; 0,060 &amp; 0,106\\
1,10 &amp; 0,095 &amp; 0,277\\
1,15 &amp; 0,152 &amp; 0,523\\
1,20 &amp; 0,229 &amp; 0,755\\
1,30 &amp; 0,427 &amp; 0,972\\
1,50 &amp; 0,802 &amp; 1,000\\
 tabular
 table

При мощности \(80\%\) одна последовательность Мерсенна обнаруживает только отклонения
в \(49{,}8\%\) и более; объединение пятнадцати оснований снижает этот порог до \(21{,}2\%\).
Достижение мощности \(80\%\) против отклонения в \(10\%\) требует \(M\approx875\) событий,
против \(5\%\) — \(M\approx3319\).

Эти рубежи вычислительно недостижимы, и стоит сказать насколько. Поскольку \(M\) растёт
логарифмически по фронту поиска, удвоение фронтов по всем пятнадцати основаниям
даёт около \(9{,}6\) дополнительных событий на всю объединённую выборку. Чтобы набрать
недостающие \(657\) событий, нужно \(657/9{,}6\approx68\) удвоений, то есть рост фронтов
в \(2^{68{,}2}\approx3\cdot10^{20}\) раз. Речь идёт
не о десятилетиях, а о величине, лежащей вне досягаемости любых мыслимых вычислений.
Обе кривые мощности как функции истинного отклонения показаны на
рис. .

figure[t]
 Мощность отвержения \(\kappa=\eg\) на уровне \(\alpha=0{,}05\). Горизонтальная
линия отмечает мощность \(80\%\).
 Power of rejecting \(\kappa=\eg\) at level \(\alpha=0.05\). The horizontal
line marks \(80\%\) power.

figure

Отсюда правило чтения для этой литературы. Сообщение о том, что данные согласуются с ЛПВ
с точностью до нескольких процентов, не есть свидетельство в пользу ЛПВ на уровне
нескольких процентов; оно совместимо с константой, ошибочной в полтора раза.
Объединённый анализ устанавливает, однако, настоящую границу: универсальная константа,
если она существует, лежит примерно в \([1{,}61;\,2{,}13]\), и ни одно основание от неё
различимо не отклоняется.

Та же ошибка в ином обличье

Счётная функция Мерсенна провоцирует родственную ошибку, которую мы приводим как
разобранный пример. Регрессия \(\pi_2(t)\) на \(t\) в точках событий по \(50\) дважды
проверенным показателям (нумерация \(0,\dots,N-1\): наименьший показатель есть начало
отсчёта, а не событие) даёт наклон \(2{,}6391\) и свободный член \(-2{,}9627\) при
стандартной ошибке МНК \(0{,}4469\), на вид значимый и наводящий на мысль о вторичном
члене в . Ничего подобного.

Складываются два дефекта. Остатки кумулятивного счёта сильно автокоррелированы,
здесь \(\rho_1=0{,}825\); ковариационная оценка Ньюи — Уэста с восемью лагами
увеличивает стандартную ошибку до \(0{,}7315\). Существеннее то, что регрессия использует
только точки событий и тем самым отбрасывает пустой интервал между последним показателем
и фронтом поиска. Корректная нулевая модель удерживает интервал \([t_0,T]\) фиксированным,
где \(T=\ln X_{\mathrm{ver}}\), и обусловливается ровно \(N-1=49\) событиями строго правее
\(t_0\), что по предложению означает \(49\) независимых равномерных точек
на \((t_0,T]\). По \(20\,000\) таким реализациям свободный член имеет медиану \(-1{,}498\) и
\(5\)–\(95\%\) диапазон \([-5{,}99;\,2{,}20]\), что даёт \(p=0{,}562\) для наблюдённого значения.
Вторичный член есть артефакт обусловливания.

Три следствия одного и того же обусловливания

(i) Бутстрэп не спасает. Естественная реакция на подозрительно малую
стандартную ошибку МНК — бутстрэп по точкам событий. На данных основания 2
бутстрэп по \(20\,000\) ресемплам даёт медиану \(-2{,}949\), стандартное отклонение
\(0{,}387\) и \(95\%\) интервал \([-3{,}822;\,-2{,}300]\), целиком лежащий ниже нуля; доля отрицательных значений
равна \(100\%\). Это не подтверждение, а повторение той же ошибки: ресемплинг наблюдённых
точек воспроизводит изменчивость внутри реализованной конфигурации и не может
восстановить изменчивость самого процесса, породившего эту конфигурацию. Корректное
нулевое распределение примерно в шесть с половиной раз шире бутстрэпного.

(ii) Мнимая недодисперсия. Сравнение наблюдённого \(\max_i|r_i|=6{,}347\),
где \(r_i=i-\hat\lambda(t_i-t_0)\), с симуляцией необусловленного пуассоновского
процесса наводит на вывод, что счётная функция &lt;&lt;глаже пуассоновской&gt;&gt;. Против
корректного нулевого распределения — с обусловливанием на \(N-1\) событий и оценкой
\(\lambda\) по последнему из них — медиана равна \(5{,}134\), а двусторонний уровень
значимости составляет \(0{,}539\). Наблюдение совершенно рядовое.

(iii) &lt;&lt;Серединный дефицит&gt;&gt;. Оценивание \(\lambda\) по последнему событию
обращает остаток \(r\) в нуль на обоих концах (\(r(t_0)=r(t_N)=0\) при правильной
нумерации), превращая его траекторию в аналог броуновского моста, для которого
отрицательная экскурсия в середине диапазона возникает сама собой. Наблюдённая средняя
экскурсия на средней половине диапазона равна \(-3{,}13\) при медиане симуляций
\(-0{,}001\) и \(p=0{,}280\); доля реализаций с отрицательной средней экскурсией
составляет \(0{,}500\), то есть систематического дефицита нет. Сама траектория
остаточного процесса вместе с полосой симуляций приведена на
рис. .

figure[t]
 Остаточный процесс \(r(t)\) для основания \(b=2\) вместе с полосой \(5\)–\(95\%\)
квантилей \(20\,000\) симуляций и медианой симуляций. Траектория лежит внутри полосы.
 The residual process \(r(t)\) for base \(b=2\) together with the
\(5\)–\(95\%\) quantile band of \(20\,000\) simulations and the simulation median. The
trajectory stays inside the band.

figure

Основание 2 на известном фронте

Основание 2 — единственное, где фронт опубликован, и потому единственное, где возможен
анализ по схеме B без всяких предположений. С \(T=\ln X_{\mathrm{ver}}\) получаем
\(\hat\lambda=(N-1)/(T-t_0)=2{,}796\) против \(\eg/\ln2=2{,}570\), то есть
\(\hat\kappa_2=1{,}938\) при точном \(95\%\) интервале Гарвуда \([1{,}434;\,2{,}562]\) и
пуассоновском \(p=0{,}59\) (удвоенный хвост; при mid-\(p\)-конвенции \(0{,}54\) — конвенцию
здесь необходимо оговаривать, поскольку различие ощутимо). Условная оценка того же
среза данных — те же \(50\) дважды проверенных показателей — даёт
\(\tilde\kappa_2=1{,}905\); различие невелико, поскольку последний показатель этого среза
\(77\,232\,917\) случайно оказался очень близко к фронту \(81\,648\,221\). (Для сравнения,
условная оценка по всем \(52\) известным показателям, приведённая в
таблице , равна \(1{,}921\); сопоставлять её с \(\hat\kappa_2\) нельзя —
это другая выборка.) Это совпадение
одной реализации, а не свойство метода: смещение относится к среднему
по положению последнего события относительно фронта.

Теоретический вторичный член имеет противоположный знак

Существует независимый довод против содержательной трактовки свободного члена \(C_1\).
Если вторичный член в происходит из постоянной Мертенса
\(\mathfrak M=0{,}26150\ldots\), то естественная его величина есть
\((\eg/\ln2)\mathfrak M=+0{,}672\): знак положительный, тогда как наблюдается
\(-2{,}963\). Ближайшие теоретические кандидаты не просто не воспроизводят наблюдаемую
величину, а предсказывают противоположный знак. Это независимо от предыдущего
подтверждает, что \(C_1\) — параметр аппроксимации, а не структуры.

Структурные поправки

Рассмотрим более общую параметризацию интенсивности \(\lambda_b=(\kappa/\ln b)\,C_b\)
и четыре модели множителя:
\[\text{A:}&amp;\quad C_b=1;\\
\text{B:}&amp;\quad C_b=\prod_{p\mid b-1,\ p\ne2}\Bigl(\tfrac{p}{p-1}\Bigr)^{\alpha}
 \prod_{p\mid b+1,\ p\ne2}\Bigl(\tfrac{p}{p-2}\Bigr)^{\beta};\\
\text{C:}&amp;\quad C_b=\prod_{p\mid b^2-1}\Bigl(\tfrac{p}{p-1}\Bigr)^{\delta};\\
\text{D:}&amp;\quad C_b=\exp\bigl(\theta_1\omega(b-1)+\theta_2\omega(b+1)+\theta_3\ln b\bigr).\]
Показатель в модели C обозначен через \(\delta\), а не \(\gamma\), чтобы не смешивать его
с постоянной Эйлера. Результаты в таблице . Ни одна параметризация не
даёт значимого улучшения; байесовские факторы по BIC при \(n=M=218\) подавляюще
поддерживают базовую модель.

table[t]
 Сравнение структурных моделей. Правдоподобие — условное 
с множителем \(C_b\); LR и \(p\) даны относительно модели A; BIC вычислен при \(n=M=218\).
 Comparison of structural models. The likelihood is the
conditional one with factor \(C_b\); LR and \(p\) are relative to
model A; BIC is computed with \(n=M=218\).

tabularlrrrrrrr
 Модель &amp; параметров &amp; \(\ln L\) &amp; LR &amp; \(p\) &amp; AIC &amp; BIC &amp; \(P(\text{модель}\mid\text{данные})\)\\
 A &amp; 1 &amp; \(-176{,}129\) &amp; — &amp; — &amp; 354,26 &amp; 357,64 &amp; 0,893\\
B &amp; 3 &amp; \(-175{,}494\) &amp; 1,27 &amp; 0,530 &amp; 356,99 &amp; 367,14 &amp; 0,008\\
C &amp; 2 &amp; \(-175{,}647\) &amp; 0,96 &amp; 0,326 &amp; 355,29 &amp; 362,06 &amp; 0,098\\
D &amp; 4 &amp; \(-174{,}925\) &amp; 2,41 &amp; 0,492 &amp; 357,85 &amp; 371,39 &amp; 0,001\\
 tabular
 table

remark[Чувствительность BIC]
Выбор эффективного объёма выборки для BIC неочевиден: правдоподобие 
имеет \(B=15\) независимых слагаемых, но информация растёт как \(M=218\). При \(n=15\)
апостериорные вероятности составляют \(0{,}624\) / \(0{,}079\) / \(0{,}261\) / \(0{,}036\),
при \(n=218\) — \(0{,}893\) / \(0{,}008\) / \(0{,}098\) / \(0{,}001\). Вывод в пользу модели A
при обоих выборах, но при \(n=218\) он существенно сильнее. Мы отчитываемся по \(n=M\)
как соответствующему числу независимых событий.
 remark

Фиксированная арифметическая поправка. Отдельно рассмотрена модель с
фиксированным (не оцениваемым) множителем
\(C^{\mathrm{fix}}_b=\prod_{p\mid b-1,p\ne2}\frac{p}{p-1}\prod_{p\mid b+1,p\ne2}\frac{p}{p-2}\),
для которого \(\overline{C_b}=2{,}46\). Она даёт \(\hat\kappa=0{,}815\). Подчеркнём, что
сравнивать это значение с \(\eg\) бессмысленно: в перепараметризованной модели \(\kappa\)
имеет иной масштаб, и такой &lt;&lt;критерий согласия&gt;&gt; проверял бы лишь равенство среднего
\(C_b\) единице. Поскольку модели A и \(C^{\mathrm{fix}}\) ненестированы и имеют одинаковое
число свободных параметров, корректное сравнение — прямо по правдоподобию:
\(\ln L=-193{,}55\) против \(-176{,}13\), разность \(-17{,}42\). Фиксированная поправка
решительно отвергается.

Логарифмические поправки. Модель \(\lambda_b(t)=(\kappa/\ln b)(1+c_1/t+c_2/t^2)\)
оценивается полным правдоподобием точечного процесса
\(\sum_i\ln\lambda(t_i)-\int\lambda\) (правдоподобие одного лишь счёта здесь
недопустимо: оно отбрасывает положения событий, которыми только и определяются
\(c_1,c_2\)). Получаем \(\hat\kappa=2{,}049\), \(\hat c_1=+0{,}108\), \(\hat c_2=-0{,}826\),
\(\mathrm{LR}=3{,}53\) при двух степенях свободы, \(p=0{,}171\). Незначимо.

Заключение

OL
• Употребительные оценки нормированной частоты обобщённых репьюнитных простых
не смещены схемой подгонки: и концевая форма, и наклон МНК несмещены точно.
Смещена лишь обратная величина, и это следствие выпуклости. Ходовое объяснение
&lt;&lt;медленной сходимости снизу&gt;&gt; через цензурирование несостоятельно.

• Настоящий дефект употребительной практики — в том, что различные формы оценки
расходятся до \(29{,}5\%\), а точечные значения публикуются без доверительных интервалов
при том, что стандартные ошибки МНК в этой задаче занижены примерно в \(1{,}6\) раза.
Классификация оснований на &lt;&lt;удачливые&gt;&gt; и &lt;&lt;неудачливые&gt;&gt; переворачивается от смены
формы оценки на неизменных данных.

• Объединение \(B=15\) оснований даёт \(M=218\) событий и точный пивот
\(\kappa S\sim\Gam(M,1)\), но этот пивот откалиброван под схему наблюдения &lt;&lt;до \(N\)-го
события&gt;&gt;, тогда как данные получены при фиксированном фронте поиска. При реальной
схеме номинальный \(5\%\) критерий отвергает в \(16{,}2\%\) случаев, а правильной
объединённой оценкой оказывается \((M-B)/S\): условное правдоподобие стоит
одного события на каждое основание, а не одного события в сумме. Различение
таких схем восходит к теории надёжности; новым здесь является случай
недокументированного фронта, когда экспозицию нельзя взять из протокола и её
приходится восстанавливать из находок (замечание ).

• Это даёт \(\kappa=1{,}838\) при \(95\%\) интервале \([1{,}61;\,2{,}13]\) и
\(p=0{,}639\) против \(\eg\). Сообщавшееся десятипроцентное превышение над ЛПВ, включая
наше собственное в более ранней редакции этой работы, есть артефакт схемы наблюдения.
Переход к схеме B независимо устраняет и систематический тренд объединённой оценки
при усечении по \(n_{\min}\).

• Выбор между \((M-1)/S\) и \((M-B)/S\) не решается данными: обе оценки суть функции
одних и тех же достаточных статистик и различаются на \(7\%\). Практическое следствие —
необходимость публиковать фронты поиска \(L_b\), как это делает GIMPS для \(b=2\).
До тех пор любой объединённый анализ этих последовательностей несёт неустранимую
неопределённость порядка \(7\%\) — вдвое больше остаточного разрыва с ЛПВ.

• Гипотеза ЛПВ имеющимися данными не отвергается, а базозависимые поправки не
требуются. Но и то и другое — утверждения о низкой чувствительности критериев:
критерий однородности различает лишь разброс \(\kappa_b\) порядка \(\pm34\%\), а
объединённый критерий — отклонения константы не менее \(21\%\). Достижение
чувствительности в \(10\%\) потребовало бы роста фронтов поиска примерно в \(3\cdot10^{20}\) раз.
/OL

Верификация исходных данных

Все двадцать последовательностей (пятнадцать основного набора и пять из проверки
границы отбора) сверены с записями OEIS 27 августа 2026 г.
Поскольку в объединённый анализ входят только тройки \((N_b,n_{\min},n_{\max})\),
в таблице приведены число известных простых, из которого
\(N_b\) получается вычитанием единицы, и оба крайних индекса; полные списки
индексов содержатся в скрипте analysis.py.

table[h]
 Сверка с OEIS. Столбец &lt;&lt;последнее пополнение&gt;&gt; указывает происхождение
наибольшего известного индекса.
 Cross-check against OEIS. The column «last addition» gives the
provenance of the largest known index.

tabularrlrrrl
 \(b\) &amp; OEIS &amp; простых &amp; \(n_{\min}\) &amp; \(n_{\max}\) &amp; последнее пополнение\\
 2 &amp; A000043 &amp; 52 &amp; 2 &amp; 136\,279\,841 &amp; GIMPS, окт.\ 2024\\
3 &amp; A028491 &amp; 23 &amp; 3 &amp; 8\,530\,117 &amp; P. Bourdelais\\
5 &amp; A004061 &amp; 19 &amp; 3 &amp; 3\,300\,593 &amp; P. Bourdelais\\
6 &amp; A004062 &amp; 17 &amp; 2 &amp; 3\,360\,347 &amp; P. Bourdelais\\
7 &amp; A004063 &amp; 10 &amp; 5 &amp; 1\,264\,699 &amp; P. Bourdelais\\
10 &amp; A004023 &amp; 11 &amp; 2 &amp; 8\,177\,207 &amp; Propper и Batalov, май 2021\\
11 &amp; A005808 &amp; 13 &amp; 17 &amp; 1\,868\,983 &amp; P. Bourdelais\\
12 &amp; A004064 &amp; 14 &amp; 2 &amp; 769\,543 &amp; P. Bourdelais, дек.\ 2014\\
13 &amp; A016054 &amp; 13 &amp; 5 &amp; 1\,503\,503 &amp; P. Bourdelais\\
14 &amp; A006032 &amp; 11 &amp; 3 &amp; 1\,724\,417 &amp; P. Bourdelais, 13.07.2026\\
15 &amp; A006033 &amp; 10 &amp; 3 &amp; 639\,833 &amp; P. Bourdelais, 22.04.2019\\
17 &amp; A006034 &amp; 12 &amp; 3 &amp; 1\,990\,523 &amp; P. Bourdelais, 03.08.2020\\
18 &amp; A133857 &amp; 8 &amp; 2 &amp; 1\,270\,141 &amp; P. Bourdelais\\
19 &amp; A006035 &amp; 11 &amp; 19 &amp; 209\,359 &amp; P. Bourdelais, 27.08.2010\\
20 &amp; A127995 &amp; 9 &amp; 3 &amp; 984\,349 &amp; P. Bourdelais\\
 tabular
 table

Отдельно предупредим читателя, сверяющего данные по вторичным источникам: сводные
таблицы (страница &lt;&lt;Repunit primes&gt;&gt; в OEIS Wiki, статья &lt;&lt;List of repunit primes&gt;&gt;
в Википедии) обновляются с запаздыванием и на момент написания работы отставали
от самих записей OEIS на один член у оснований \(b=14,15,17,18,20\). Авторитетным
источником следует считать записи OEIS.

Независимый пересчёт префиксов

Сверка с OEIS подтверждает, что перечисленные индексы дают простое, но не
гарантирует полноты: пропущенный член сдвинул бы \(N_b\), а с ним и обе
объединённые оценки. Этот пробел мы закрыли прямым пересчётом. Для каждого из
двадцати оснований \(2\le b\le26\), не являющихся точными степенями, независимой
реализацией (Гибридный CPU/GPU поисковик: сегментное сито по малым
делителям, trial factoring в арифметике Монтгомери, PRP через GMP и GWNUM/IBDWT.
Исходный код и протокол прогонов — в том же репозитории, скрипты
verify_sequences.sh и compare_verify.py.) проверены
все индексы \(n&lt;10^4\) подряд, а не только перечисленные в OEIS. Каждый
отрицательный вердикт пересчитан вторым, независимым бэкендом (сплошной
double-check, как в GIMPS), чтобы исключить потерянную находку.

Результат: \(153\) члена подтверждены, лишних нет, пропущенных нет, расхождений
между бэкендами нет — по всем двадцати основаниям. Покрытие по основаниям
неравномерно (от одного члена при \(b=18\) до двадцати двух при \(b=2\)): на
основной набор \(b\le20\) приходится \(128\) подтверждённых индексов из \(233\)
известных. Выше \(10^4\) полный пересчёт вычислительно недоступен, и там мы
по-прежнему опираемся на OEIS.

Отметим, что этот пересчёт не был формальностью: в первом прогоне независимая
реализация объявила \(R_{3181}(23)\) составным, разойдясь с A204940. Разбор показал
ошибку в самой реализации — всплеск ошибки округления FFT на последней итерации,
после последней периодической проверки, — а не в данных OEIS. После исправления
расхождений не осталось. Мы приводим этот эпизод как иллюстрацию к тезису
 : ложное &lt;&lt;составное&gt;&gt; невидимо без повторного счёта, и именно
поэтому фронты и протоколы проверки должны публиковаться.

Доступность данных и кода

Все использованные последовательности приведены в таблице .

Данные. Скрипт fetch_data.sh загружает b-файлы OEIS для всех
пятнадцати последовательностей основного набора, fetch_extra.sh — для
пяти оснований \(21\le b\le26\), использованных в проверке границы отбора
( ). Загруженные файлы включены в репозиторий, так что анализ
воспроизводится без обращения к сети.

Анализ. Один самодостаточный скрипт analysis.py (numpy, scipy,
matplotlib); каждое число настоящей работы помечено в его выводе
(results.txt) тегом соответствующей таблицы или раздела и воспроизводится
одним запуском. Генератор случайных чисел инициализирован фиксированным зерном,
поэтому все величины Монте-Карло воспроизводятся побитово. Скрипт также строит
все четыре рисунка. Полный прогон занимает несколько минут.

Независимый пересчёт последовательностей. verify_sequences.sh
запускает поисковик по всем индексам \(n&lt;10^4\) для каждого основания,
compare_verify.py сверяет результат с b-файлами OEIS и возвращает
ненулевой код при любом расхождении (приложение ).

Оговорка о величинах Монте-Карло. Концы интервала зависят от
процедуры инверсии, а таблицы , и —
от правил расположения фронта. И то и другое описано в тексте и реализовано в
analysis.py; все приведённые в работе значения — в точности вывод этого
скрипта при зерне, зафиксированном в нём. Точность симуляций: для уровня
значимости в таблице около \(\pm0{,}003\), для средних в
таблице — около \(\pm0{,}3\%\).

Репозиторий: — каталог
paper/. Дерево файлов и порядок запуска описаны в paper/README.md.

Список источников
 thebibliography9

wagstaff1983 Wagstaff S. S., Jr. Divisors of Mersenne numbers //
Mathematics of Computation. 1983. Vol. 40, № 161. P. 385–397.
DOI: 10.1090/S0025-5718-1983-0679454-X.

pomerance1981 Pomerance C. On the distribution of pseudoprimes //
Mathematics of Computation. 1981. Vol. 37, № 156. P. 587–593.
DOI: 10.1090/S0025-5718-1981-0628717-0.

t5k Heuristics: deriving the Wagstaff Mersenne conjecture
[Электронный ресурс] // The PrimePages: prime number research and records.
URL: (дата обращения: 27.08.2026).

dubner1993 Dubner H. Generalized repunit primes //
Mathematics of Computation. 1993. Vol. 61, № 204. P. 927–930.
DOI: 10.1090/S0025-5718-1993-1185243-9.

bourdelais2009 Bourdelais P. A generalized repunit conjecture
[Электронный ресурс] // NMBRTHRY mailing list. 25 June 2009.
URL: 
(дата обращения: 25.08.2026).

oeis The On-Line Encyclopedia of Integer Sequences
[Электронный ресурс] / OEIS Foundation Inc.
URL: (дата обращения: 27.08.2026).

wagstaff2025 Wagstaff S. S., Jr. Two conjectures about Mersenne primes
[Электронный ресурс] // Journal of Integer Sequences. 2025. Vol. 28.
Article 25.7.2.
URL: 
(дата обращения: 25.08.2026).

dominguez2026 Dominguez J. Arithmetic bias in the distribution of Mersenne
prime exponents and the divisor structure of \(p-1\) [Электронный ресурс] // arXiv.
2026. arXiv:2603.08994. URL: 
(дата обращения: 27.08.2026).

jha2026 Jha A. The Poisson tail conjecture for primes in short intervals
[Электронный ресурс] // arXiv. 2026. arXiv:2605.23014.
URL: (дата обращения: 27.08.2026).

gimps PrimeNet [Электронный ресурс] / Great Internet Mersenne Prime
Search (GIMPS). Программное обеспечение Prime95/MPrime, версия 30.8.
URL: (дата обращения: 27.08.2026;
отчёт Milestones считан 27.08.2026 04:30 UTC).

epstein1954trunc Epstein B. Truncated life tests in the exponential
case // The Annals of Mathematical Statistics. 1954. Vol. 25, № 3. P. 555–564.
DOI: 10.1214/aoms/1177728723.

epsteinsobel1954 Epstein B., Sobel M. Some theorems relevant to life
testing from an exponential distribution // The Annals of Mathematical
Statistics. 1954. Vol. 25, № 2. P. 373–381. DOI: 10.1214/aoms/1177728793.

bartholomew1963 Bartholomew D. J. The sampling distribution of an
estimate arising in life testing // Technometrics. 1963. Vol. 5, № 3.
P. 361–374.

basu1964 Basu A. P. Estimates of reliability for some distributions
useful in life testing // Technometrics. 1964. Vol. 6, № 2. P. 215–219.

kivela2015 Kivel\&quot;a M., Porter M. A. Estimating interevent time
distributions from finite observation periods in communication networks //
Physical Review E. 2015. Vol. 92, № 5. Article 052813.
DOI: 10.1103/PhysRevE.92.052813.

thebibliography

otherlanguageenglish

References

OL 2pt
• Wagstaff S. S., Jr. Divisors of Mersenne numbers.
Mathematics of Computation, 1983, vol. 40, no. 161, pp. 385–397.
DOI: 10.1090/S0025-5718-1983-0679454-X

• Pomerance C. On the distribution of pseudoprimes.
Mathematics of Computation, 1981, vol. 37, no. 156, pp. 587–593.
DOI: 10.1090/S0025-5718-1981-0628717-0

• Heuristics: deriving the Wagstaff Mersenne conjecture. The PrimePages:
prime number research and records. Available at:
 (accessed 27.08.2026).

• Dubner H. Generalized repunit primes.
Mathematics of Computation, 1993, vol. 61, no. 204, pp. 927–930.
DOI: 10.1090/S0025-5718-1993-1185243-9

• Bourdelais P. A generalized repunit conjecture. NMBRTHRY mailing
list, 25 June 2009. Available at:

(accessed 25.08.2026).

• OEIS Foundation Inc. The On-Line Encyclopedia of Integer
Sequences. Available at: (accessed 27.08.2026).

• Wagstaff S. S., Jr. Two conjectures about Mersenne primes.
Journal of Integer Sequences, 2025, vol. 28, article 25.7.2.
Available at:

(accessed 25.08.2026).

• Dominguez J. Arithmetic bias in the distribution of Mersenne prime exponents
and the divisor structure of \(p-1\). arXiv, 2026, arXiv:2603.08994. Available
at: (accessed 27.08.2026).

• Jha A. The Poisson tail conjecture for primes in short intervals.
arXiv, 2026, arXiv:2605.23014. Available at:
 (accessed 27.08.2026).

• Great Internet Mersenne Prime Search (GIMPS). PrimeNet.
Prime95/MPrime software, version 30.8. Available at:
 (accessed 27.08.2026).

• Epstein B. Truncated life tests in the exponential case.
The Annals of Mathematical Statistics, 1954, vol. 25, no. 3,
pp. 555–564. DOI: 10.1214/aoms/1177728723

• Epstein B., Sobel M. Some theorems relevant to life testing from an
exponential distribution. The Annals of Mathematical Statistics, 1954,
vol. 25, no. 2, pp. 373–381. DOI: 10.1214/aoms/1177728793

• Bartholomew D. J. The sampling distribution of an estimate arising in
life testing. Technometrics, 1963, vol. 5, no. 3, pp. 361–374.

• Basu A. P. Estimates of reliability for some distributions useful in
life testing. Technometrics, 1964, vol. 6, no. 2, pp. 215–219.

• Kivel\&quot;a M., Porter M. A. Estimating interevent time distributions
from finite observation periods in communication networks.
Physical Review E, 2015, vol. 92, no. 5, article 052813.
DOI: 10.1103/PhysRevE.92.052813
/OL

otherlanguage

Информация об авторе

Тимофей Сергеевич Докучаев —
независимый исследователь, Иркутск, Россия,
timofei93@yandex.ru,

otherlanguageenglish

Information about the author

Timofei Sergeevich Dokuchaev —
independent researcher, Irkutsk, Russia,
timofei93@yandex.ru, 
 otherlanguage

Автор заявляет об отсутствии конфликта интересов.

otherlanguageenglish
 The author declares no conflicts of interests.
 otherlanguage
