Чтобы провести тест последних цифр, подсчитайте, сколько раз каждая из возможных пар встречается в имеющемся наборе данных. Всего таких пар 100, и поэтому потребуется составить гистограмму из 100 столбиков.
Ниже приведена гистограмма, дающая представление, как выглядят реальные данные. Она характеризует выборку из 500 случайных чисел (сгенерированных программой Excel). Число 500 достаточно репрезентативно для мелкого бизнеса – это около 17 месяцев ежедневных продаж или десять лет еженедельных. Но даже при 500 числах гистограмма получается неравномерной, с довольно большими вариациями. В данном случае одна пара цифр (68) не появляется совсем, а три пары (10, 53 и 74) встречаются в два раза чаще, чем ожидаемый 1 процент. Это нормальные отклонения, характерные для случайных данных.
Теперь посмотрим на сфабрикованные данные.
Следующая гистограмма отображает распределение двух последних цифр в 500 числах, придуманных человеком. Более сильные вариации видны даже с первого взгляда. Две пары (93 и 94) встречаются более чем в 4 процентах чисел, что маловероятно для реальных данных. Двенадцать пар не встречаются вообще, и это тоже крайне маловероятно.
Задайте себе следующие три вопроса. Утвердительный ответ на любой из них должен усилить ваши подозрения.
a) По непонятной причине есть пара (или пары) цифр, встречающиеся чаще остальных?
б) Частота повторения сдвоенных цифр (особенно 00 и 55) меньше средней?
в) Убывающие пары (10, 21, 32, 43, 54, 65, 76, 87, 98) явно встречаются чаще других?
В приведенном примере ответ на вопрос (a) утвердителен. Кроме того, в массиве данных нет сдвоенных цифр (б). Приблизительно 10 процентов всех чисел должны оканчиваться на сдвоенные цифры. У нас таких 20 из 500, всего 4 процента. Пары 00, 55 и 77 вообще не встречаются.
Из 500 пар последних цифр 44 – убывающие. Это почти точно ожидаемые 9 процентов (из 100 возможных пар девять убывающие). Так, по критерию (в) данные не вызывают подозрений.
Наш набор данных не прошел два из трех тестов. Будь это суммы продаж мелкого бизнеса, стоило бы запросить дополнительную или более подробную информацию – и посмотреть, как отреагирует продавец.
Нет нужды беспокоиться, что вам придется считать вручную. На практике все это делается с помощью функций «копировать» и «вставить». Попросите данные в виде таблицы Excel или в совместимом с ней формате, чтобы без труда перенести их в шаблон теста, использующего закон Бенфорда. Примеры таких тестов можно бесплатно найти в интернете, в том числе один тест Нигрини (NigriniCycle.xlsx). Перенеся данные, выполните инструкции и заполните определенные столбцы заранее известными формулами. Результатом будут отформатированные гистограммы для двух последних цифр и итоги других распространенных тестов. Кроме того, программа вычисляет математическую оценку статистической значимости, что, конечно, гораздо надежнее простого просмотра полученных данных.