Google Open Buildings: датасет на 1.8 миллиарда домов
Публикации

Google Open Buildings: датасет на 1.8 миллиарда домов

Представьте: вы работаете в НПО в Индии. Нужно посчитать, сколько людей пострадает от наводнения. Открываете OpenStreetMap — там пусто. Пробуете купить данные — вам предлагают $50 за км², а вам нужна вся страна. До 2021 года так работала половина планеты. Африка, Южная Азия, Латинская Америка — там не было базовых карт. Не потому что люди не хотели мапить, а потому что мапить некому.

Google посмотрел на свои спутники и сказал: «А давайте натравим нейросеть…»

Что внутри: 50 см на пиксель и 1.8 миллиарда полигонов

Датасет данных по застройке Open Buildings собран из снимков с разрешением 50 см — это детальнее, чем бесплатный Sentinel-2 (10 м) в 400 раз. Модель прошлась по Африке, Индии, Индонезии, Мексике, Бразилии и ещё 30+ странам.

Масштабы колоссальные:

  • 58 млн км² покрытия
  • 1.8 млрд зданий
  • От фавел в Рио до хижин в Сахеле

Каждое здание — полигон с площадью и confidence score (0.65–1.0). Никаких адресов, этажности, цвета крыши. Только геометрия и метрика «насколько модель уверена, что это не корова».

Главная боль: 20 гигабайт CSV

Google раздаёт данные как gzip-архивы CSV. Звучит нормально, пока не скачаешь Индию — 20 ГБ сжатого файла с 88 миллионами строк. Но в 2024 году сообщество решило эту проблему. Данные переконвертировали в GeoParquet с партиционированием по странам. Теперь можно сделать так:

import duckdb
con = duckdb.connect()
con.execute("""
 SELECT * FROM 's3://bucket/indonesia.parquet' 
 WHERE confidence > 0.8
""")

И получить выборку за секунды, не скачивая 14 гигабайт.

Качество: не идеально, но бесплатно

Вот пример плотной застройки в Маниле. Зелёные полигоны — разметка Open Buildings. Видны артефакты: иногда модель сливает соседние дома или пропускает навесы. Также есть проблемы с ложными срабатываниями (тени, скалы, грузовики), а мелкие постройки в трущобах модель может проигнорировать.

На самом деле Open Buildings data это не просто датасет. Это инфраструктурная справедливость. Развитые страны имеют кадастры с XIX века, а страны Global South — нет. Google Open Buildings даёт им базовый слой для планирования водоснабжения, оценки рисков бедствий, подсчёта населения по плотности застройки. И всё это под лицензией CC-BY — можно использовать в коммерческих проектах, можно форкать, можно улучшать.

Единственный вопрос: если корпорация может создать такое за 3 года, почему открытые сообщества не сделали это за 20? И не станет ли AI-разметка новым стандартом де-факто для базовых геоданных?