Как читать демографию района: доход, возраст и почему «средний чек» обманчив
Демография — самый недооценённый слой данных о городе. Разбираем, как читать доход, возраст и состав домохозяйств по кварталу и почему среднее по району врёт чаще, чем помогает.
Демография — самый недооценённый слой данных о городе. На него смотрят последним и обычно сводят к одной цифре среднего дохода, а именно эта цифра врёт чаще всего. Среднее склеивает разные сегменты в несуществующую величину: в районе с бедными и богатыми «средний» доход не описывает никого. Правильное чтение — это распределение, а не среднее: какие доли населения попадают в вашу аудиторию, какой возрастной состав, какие домохозяйства. Слой demo.profile отдаёт это поквартально и обезличенно, и именно он объясняет, почему высокий трафик бывает бесполезен.
Дальше — как читать этот слой, где главные ловушки и почему «средний чек по району» стоит выкинуть из головы.
Почему демографию смотрят последней и зря
В обоих наших разборах site selection демография стояла третьим слоем, после трафика и конкуренции. Это типичный порядок: сначала считают, сколько людей проходит, потом сколько рядом конкурентов, и только потом, кто эти люди. Но именно демография чаще всего и переворачивает решение.
Вспомните разбор про кофейню. Адрес у Ходынки имел суточный трафик 15 800 человек против 11 400 у победителя. По трафику он выигрывал. Проиграл он на демографии: поток складывался из семей, которые будним утром уезжают на работу в другой район, а мимо кофейни идут вечером с коляской. 15 800 человек оказались не теми людьми не в то время. Без слоя демографии этот адрес выглядел бы лучшим.
Демография — это поправка, которая превращает «сколько людей» в «сколько нужных людей». Без неё трафик читается наивно: больше значит лучше. С ней становится видно, что большой поток не той аудитории стоит меньше, чем умеренный поток точно вашей.
Три измерения, из которых складывается портрет района
Слой demo.profile(geo) отдаёт не одну цифру, а структуру по трём осям сразу. Разберём каждую.
Доход. Не средний, а распределение по сегментам: какая доля домохозяйств в каком диапазоне. Сегментация обычно идёт буквами (A — высокий доход, B — средний, C — низкий) с подразбивкой. Важно не то, какой сегмент «преобладает», а какие доли: район может быть формально «сегмента B», но с заметным хвостом сегмента A, и для премиального продукта важен именно этот хвост.
Возраст. Распределение по возрастным группам и, что важнее, ядро — доминирующая группа. Молодой район с ядром 25-35 и район с ядром 55+ это две разные экономики потребления, даже при одинаковом доходе. Возраст определяет не только что покупают, но и как: онлайн или офлайн, импульсно или планово.
Состав домохозяйств. Одиночки, пары без детей, семьи с детьми, пожилые. Это ось, которую забывают чаще всего, а она определяет ритм района сильнее дохода. Семьи с детьми задают вечерне-выходной ритм и высокий онлайн-спрос. Одиночки и молодые пары — будний вечерний и импульсный. Пожилые — дневной и локальный.
Главная ловушка: почему среднее врёт
Теперь о цифре, ради которой стоит писать всю статью. «Средний доход по району» — это самая популярная и самая обманчивая метрика демографии.
Проблема среднего в том, что оно склеивает структуру в одну точку. Возьмём два района с одинаковым средним доходом 180 000 ₽:
- Район «ровный»: почти все домохозяйства в диапазоне 150-210 тысяч. Среднее 180 описывает реальных людей.
- Район «расколотый»: половина домохозяйств около 70 тысяч, половина около 290 тысяч. Среднее то же, 180, но людей с доходом 180 тысяч там почти нет.
Для бизнеса это два совершенно разных места. В «ровном» районе продукт за условные 180 попадает в массу. В «расколотом» он не нужен никому: бедной половине дорого, богатой неинтересно. А по средней цифре они выглядят близнецами.
Одна и та же средняя цифра ≈180к ₽ описывает две несовместимые структуры. В «ровном» районе ядро попадает в среднее, в «расколотом» в середине почти никого нет. Доли условные, для иллюстрации.
Вывод простой: всегда смотрите распределение и доли сегментов, а среднее держите как грубый ориентир, не как факт. Медиана честнее среднего, но и она прячет раскол. Доли по сегментам — единственное, что показывает структуру.
Как демография корректирует трафик: разрыв «много людей» и «моя аудитория»
Самое полезное применение слоя — пересечь его с трафиком и увидеть разрыв. Высокий трафик нужной демографии и высокий трафик чужой демографии выглядят на счётчике одинаково, а стоят по-разному.
Возьмём специализированный детский магазин. Ему нужна не проходимость, а плотность семей с детьми 0-10 лет и доход от среднего. Адрес у делового кластера с трафиком 11 400 в день для него почти бесполезен: там офисные одиночки 25-40, детей нет. Адрес в спальном районе с трафиком вдвое ниже, но с ядром «семьи с детьми, сегмент B+» для него золотой. Та же логика, что переворачивала разбор кофейни, но веса осей под другой продукт.
Поэтому правильный рабочий порядок не «трафик, потом демография», а их пересечение: где совпадает достаточный поток с нужной структурой населения. Один слой без другого даёт наивный ответ.
Как это выглядит со стороны агента
Агент читает демографию не как одну цифру, а как структуру, и сам сверяет её с заданной аудиторией. Вот сокращённый лог: запрос на оценку района под детский магазин, где агент достаёт демографию и поясняет, почему средний доход тут не главное.
Агент читает демографию как структуру, а не как среднее: явно помечает, что средний доход 168к нерепрезентативен, и опирается на распределение, ядро возраста и состав домохозяйств. Цифры синтетические, для разбора.
Обратите внимание на строку, где агент сам помечает среднее как нерепрезентативное и переключается на распределение. Это и есть правильное чтение слоя, зашитое в логику: не голосовать за красивую среднюю цифру, а смотреть структуру.
Где демография врёт: честно про ограничения
Без этого раздела был бы маркетинг. Демография — это статистическая оценка, и у неё свои честные границы.
Первое: это модель, а не перепись. Слой выводит портрет района из обезличенных агрегатов и поведенческих сигналов, а не из паспортов жителей. Он хорошо описывает структуру и плохо — отдельные дома. Чем мельче территория, тем выше неопределённость.
Второе: район меняется быстрее данных. Новая застройка, джентрификация, отъезд населения меняют демографию за год-два, а слой отражает накопленную картину. Для свежих ЖК особенно: расчётный портрет будущих жителей и фактический портрет наполовину заселённого дома это разные вещи.
Третье: демография не объясняет поведение целиком. Два района с одинаковой структурой потребляют по-разному из-за культуры, привычек, локальной специфики, которую агрегат не ловит. Слой сужает гипотезы, но не отменяет проверку на месте.
И базовое: данные обезличены и поквартальны в соответствии с 152-ФЗ. Конкретных людей в них нет, есть структура населения территории.
Что в сухом остатке
Демографию стоит читать первой, а не последней, и не как одну цифру среднего дохода, а как структуру по трём осям: распределение дохода (доли сегментов, а не среднее), возрастное ядро и состав домохозяйств. Среднее обманывает, потому что склеивает разные сегменты в несуществующую величину; распределение показывает реальную картину.
домохозяйства
demo.profile
и агрегировано
Главная ценность слоя — пересечь его с трафиком и увидеть разрыв между «много людей» и «моя аудитория». Именно демография переворачивала решение в разборе про кофейню и в разборе про пункт выдачи, где плотность заказов выводится как раз из неё. А чтобы портрет района был чистым, под ним лежит нормализованный слой данных о городе с обезличенными агрегатами, а не сырые источники.