Откуда берётся пеший трафик: мобильные панели, модель и почему это не перепись
Слой пешего трафика выглядит как простое число прохожих, но за ним стоит модель на обезличенных панелях. Разбираем, как он строится, что значит почасовой профиль и где ему верить.
Пеший трафик в данных о городе выглядит как простое число прохожих, но это модельная оценка, а не подсчёт. Источник — обезличенные мобильные панели: выборка геосигналов, по которой модель экстраполирует весь поток. Поэтому слой правильно читать как паттерн (где и когда людей больше), а не как точное число до человека. Самое ценное в нём — не суточный объём, а почасовой профиль и разрешение около 100 метров: они отличают будний утренний пик от вечернего выходного и солнечную сторону улицы от глухой. Дальше — как это устроено и где слою верить.
Что вообще измеряет этот слой
Начнём с того, чего слой не делает. Он не ставит человека с кликером на угол и не считает камерой каждого прохожего. Если бы считал, это была бы перепись одного перекрёстка, дорогая и не масштабируемая на город.
Вместо этого слой пешего трафика отвечает на вопрос «каков паттерн пешеходного потока через эту территорию»: сколько людей проходит в радиусе, в какие часы, как распределено по будням и выходным. Это оценка потока, а не реестр людей. И ключевое слово тут — оценка: за числом стоит модель, а не прямой подсчёт.
Эта разница не придирка к словам. От неё зависит, как цифру правильно использовать: для сравнения адресов между собой (адрес A вдвое оживлённее адреса B) она надёжна, а как абсолютное число «здесь пройдёт ровно 11 400 человек» — её надо брать с запасом.
Источник: обезличенные мобильные панели
Сырьё для слоя — обезличенные мобильные панели. Это агрегированные сигналы геолокации от выборки устройств, в которых на входе убрана привязка к конкретным людям. По модели это близко к тому, как работают Placer.ai и Foursquare на западном рынке.
Важно понять природу источника: панель — это не всё население города, а выборка. Какая-то доля людей попадает в панель, какая-то нет. Поэтому сырой сигнал показывает не весь поток, а его представительную часть, по которой дальше можно судить о целом.
И сразу про приватность, потому что это первый вопрос, который возникает. Данные обезличены и агрегированы: они выдаются территориальными агрегатами (поквартально, почасово), а не следами отдельных людей. По слою пешего трафика нельзя восстановить, кто именно прошёл, можно только сказать, сколько людей в целом проходит через территорию. Это статистика населения местности, а не слежка за прохожими, и она устроена в соответствии с 152-ФЗ. Тот же принцип лежит и под слоем демографии: обезличенные агрегаты, а не персональные данные.
От выборки к потоку: зачем нужна модель
Раз панель — это выборка, между сырым сигналом и числом на карте стоит модель. Её работа — экстраполировать: из «столько людей из панели прошло здесь» получить оценку «столько людей всего проходит здесь».
Грубо говоря, если в районе панель покрывает условную долю населения, модель масштабирует наблюдённый сигнал до полного потока, поправляя на то, что покрытие неоднородно: где-то в выборку попадает больше людей, где-то меньше, и просто умножить на один коэффициент нельзя. Модель учитывает эти перекосы, иначе районы с разным покрытием панели сравнивались бы нечестно.
Именно поэтому результат — оценка с погрешностью, а не точный счёт. Любая экстраполяция по выборке даёт интервал, а не одно идеальное число. Это не дефект слоя, а его честная природа: так устроена любая оценка потока по панелям, а не прямым подсчётом.
часть населения
разрешение
по времени
Почасовой профиль: где прячется главная ценность
Если из всего слоя оставить только одно число — суточный объём — потеряется самое полезное. Поток в 15 000 человек в день может быть утренним рабочим, вечерним прогулочным или равномерным, и это три разных бизнес-ситуации при одной и той же сумме.
Почасовой профиль раскладывает суточный объём по часам и по типу дня. И тут проявляется то, что в разборе кофейни перевернуло решение: будний утренний пик стоит дороже равного по высоте вечернего выходного, потому что утренний кофе по дороге в офис — это привычка с высокой повторяемостью, а вечерний прохожий в выходной в среднем не вернётся завтра.
Один и тот же суточный объём раскладывается на разные профили, и для бизнеса это разные ситуации. Высота столбца здесь — условная ценность профиля под формат «кофе навынос», а не объём потока.
Поэтому правильное чтение слоя — сначала профиль, потом объём. Сколько людей важно, но когда они идут и вернутся ли — важнее для большинства форматов.
Разрешение 100 метров: почему нельзя усреднять по кварталу
Вторая недооценённая часть слоя — пространственное разрешение около 100 метров. Звучит как техническая деталь, а решает, можно ли вообще доверять цифре по конкретному помещению.
Поток внутри одного квартала неоднороден. Солнечная сторона улицы с витринами и кафе собирает в разы больше пешеходов, чем глухая сторона у парковки и трансформаторной будки. Если усреднить весь квартал в одно число, эти два угла станут одинаковыми, хотя помещение на одном из них живое, а на другом мёртвое.
Разрешение в 100 метров позволяет сравнить два угла перекрёстка по отдельности. А решения о месте принимаются именно на этом масштабе: вы арендуете конкретную дверь, а не квартал. С этим же связана типовая ошибка — брать радиус по умолчанию. 300 метров в плотном центре и 300 метров вдоль широкого проспекта с редкими переходами — это разная реальная пешая доступность: реки, железные дороги и шестиполосные магистрали режут поток, и люди в двухстах метрах от вас физически могут до вас не доходить.
Как агент читает этот слой
Агент обращается со слоем не как с одним числом, а вытягивает профиль и сам сверяет его с задачей. Вот сокращённый лог: запрос на оценку адреса, где агент достаёт пеший трафик и явно отделяет объём от ритма.
Агент читает трафик как профиль плюс оценку с разрешением, а не как одно точное число. Строка confidence помечает, что объём — это оценка по панели. Цифры синтетические, для разбора.
Обратите внимание на строку confidence: агент держит в уме, что число — оценка по панели, и не выдаёт его как точный факт. Это и есть честное чтение слоя, зашитое в логику.
Где слою верить, а где нет
Без честного раздела был бы маркетинг. У слоя есть границы, и их лучше знать заранее.
Слою стоит верить в сравнениях. «Адрес A оживлённее адреса B в полтора раза», «здесь утренний пик, а там вечерний», «эта сторона улицы люднее той» — это относительные суждения, и в них оценка по панели надёжна, потому что систематические перекосы сокращаются при сравнении.
Слою не стоит верить как точному абсолютному счёту. «Здесь пройдёт ровно 11 400 человек, заложу это в выручку» — ошибка: это оценка с погрешностью, и в финансовую модель её надо брать с запасом, а не как факт. Чем мельче территория и реже панель в ней, тем шире погрешность.
И ещё две оговорки. Свежие изменения город отражает с задержкой: новый ТЦ или перекрытая улица меняют поток быстрее, чем накапливается сигнал. А сам по себе трафик не объясняет, кто эти люди, — на этот вопрос отвечает демография, и сильный сигнал получается только на их пересечении, а не из трафика в одиночку.
Что в сухом остатке
Пеший трафик — это модельная оценка потока по обезличенным мобильным панелям, а не подсчёт прохожих. Из выборки геосигналов модель экстраполирует весь поток, поэтому результат — оценка с погрешностью, надёжная в сравнениях адресов и требующая запаса как абсолютное число. Главная ценность слоя не в суточном объёме, а в почасовом профиле (когда люди идут и вернутся ли) и в разрешении около 100 метров (какая именно сторона улицы живая).
Этот слой — одно из пяти измерений, которые сходятся в разборе локации под кофейню, где трафик пересекается с демографией и конкуренцией. А чтобы поток правильно привязывался к конкретным адресам и объектам, под ним лежит нормализованный слой данных о городе: без чистой геопривязки даже идеальная оценка потока легла бы не на тот угол.