Представьте: вы работаете в НПО в Индии. Нужно посчитать, сколько людей пострадает от наводнения. Открываете OpenStreetMap — там пусто. Пробуете купить данные — вам предлагают $50 за км², а вам нужна вся страна. До 2021 года так работала половина планеты. Африка, Южная Азия, Латинская Америка — там не было базовых карт. Не потому что люди не хотели мапить, а потому что мапить некому.
Google посмотрел на свои спутники и сказал: «А давайте натравим нейросеть…»
Что внутри: 50 см на пиксель и 1.8 миллиарда полигонов
Датасет данных по застройке Open Buildings собран из снимков с разрешением 50 см — это детальнее, чем бесплатный Sentinel-2 (10 м) в 400 раз. Модель прошлась по Африке, Индии, Индонезии, Мексике, Бразилии и ещё 30+ странам.

Масштабы колоссальные:
- 58 млн км² покрытия
- 1.8 млрд зданий
- От фавел в Рио до хижин в Сахеле
Каждое здание — полигон с площадью и confidence score (0.65–1.0). Никаких адресов, этажности, цвета крыши. Только геометрия и метрика «насколько модель уверена, что это не корова».

Главная боль: 20 гигабайт CSV
Google раздаёт данные как gzip-архивы CSV. Звучит нормально, пока не скачаешь Индию — 20 ГБ сжатого файла с 88 миллионами строк. Но в 2024 году сообщество решило эту проблему. Данные переконвертировали в GeoParquet с партиционированием по странам. Теперь можно сделать так:
import duckdb
con = duckdb.connect()
con.execute("""
SELECT * FROM 's3://bucket/indonesia.parquet'
WHERE confidence > 0.8
""")
И получить выборку за секунды, не скачивая 14 гигабайт.
Качество: не идеально, но бесплатно

Вот пример плотной застройки в Маниле. Зелёные полигоны — разметка Open Buildings. Видны артефакты: иногда модель сливает соседние дома или пропускает навесы. Также есть проблемы с ложными срабатываниями (тени, скалы, грузовики), а мелкие постройки в трущобах модель может проигнорировать.
На самом деле Open Buildings data это не просто датасет. Это инфраструктурная справедливость. Развитые страны имеют кадастры с XIX века, а страны Global South — нет. Google Open Buildings даёт им базовый слой для планирования водоснабжения, оценки рисков бедствий, подсчёта населения по плотности застройки. И всё это под лицензией CC-BY — можно использовать в коммерческих проектах, можно форкать, можно улучшать.
Единственный вопрос: если корпорация может создать такое за 3 года, почему открытые сообщества не сделали это за 20? И не станет ли AI-разметка новым стандартом де-факто для базовых геоданных?