Niedawno przyjrzeliśmy się temu, jak modele bazowe zmieniają analitykę geoprzestrzenną i przedstawiliśmy naszą wizję tworzenia nowych, rozwijanych na współpracy modeli skoncentrowanych na dynamice populacji i demografii przestrzennej. Modele bazowe otwierają drogę do szerszego, szybszego i bardziej spójnego modelowania tego, jak ludzie się przemieszczają, gdzie mieszkają i jaki sposób wchodzą w interakcje z przestrzenią fizyczną. Większość tych modeli nadal pozostaje jednak przede wszystkim w rękach badaczy, a ich wykorzystanie wymaga zaawansowanych umiejętności technicznych. Naszym celem jest to zmienić.
Aby urzeczywistnić tę wizję, z przyjemnością ogłaszamy udostępnienie nowego pakietu CARTO Workflows, który pozwala użytkownikom importować i integrować embeddingi Google Population Dynamics Foundation Model (PDFM) bezpośrednio z analizami przestrzennymi. Bez konieczności pisania kodu. Wystarczy przeciągnąć, upuścić i połączyć – tak jak każdy inny węzeł w Workflows.
Pakiet rozszerzeń Geospatial Foundation Models zawiera dwa komponenty, które umożliwiają ładowanie embeddingów w dwóch rozdzielczościach przestrzennych – na poziomie hrabstw i obszarze tabeli kodów pocztowych (ZCTA) – obejmujących całe Stany Zjednoczone.

Dlaczego to ma takie ważne? Ponieważ embeddingi zapewniają kompaktowe, wielowymiarowe reprezentacje obszarów przestrzennych, które rejestrują wzorce behawioralne, demograficzne i funkcjonalne w jednym wektorze. To nowy rodzaj elementu składowego analiz geoprzestrzennych.
Jak jednak sprawdzają się w praktyce? Aby to sprawdzić, przeprowadziliśmy dwa przykłady oparte na rzeczywistych danych, wykorzystując otwarty zbiór lowa Liquor Sales, porównując wydajność modelu w oparciu o tradycyjne dane socjodemograficzne i te nowe integracje.
Zrozumienie całkowitej sprzedaży w podziale na jednostki geograficzne jest kluczowym zadaniem w wielu branżach. Niezależnie od tego, czy firma z sektora CPG szacuje popyt na określone kategorie produktów, sieć detaliczna planuje ekspansję sklepów, czy instytucja publiczna przydziela licencje lub usługi, przestrzenne prognozowanie sprzedaży wspiera podejmowanie decyzji strategicznych.
Wiele organizacji opiera się na szczegółowych danych demograficznych, takich jak dochody, poziom wykształcenia czy gęstość zaludnienia. Takie zbiory danych mogą jednak być nieaktualne, trudne do integracji lub niedostępne w wymaganej rozdzielczości przestrzennej. Embeddingi PDFM stanowią alternatywę: są to wstępnie wytrenowane, wielowymiarowe reprezentacje przestrzenne, które kodują wzorce behawioralne i funkcjonalne bez konieczności ręcznego tworzenia cech.
Aby ocenić, jak dobrze embeddingi sprawdzają się w typowym scenariuszu biznesowym, wykorzystaliśmy otwarty zbiór Iowa Liquor Sales do prognozowania całkowitej rocznej sprzedaży alkoholu według obszarów ZIP Code Tabulation Area (ZCTA) w całym stanie.
Porównaliśmy trzy konfiguracje modeli przy użyciu CARTO Workflows:
Klasyczne zmienne predykcyjne, obejmujące m.in. dochody, wykształcenie i populację, itp.
Bez ręcznie tworzonych cech – wyłącznie 330-wymiarowe wektory reprezentujące każdy obszar ZCTA.
Połączenie sygnałów demograficznych z wyuczonymi wzorcami behawioralnymi.

Wyniki:

Połączony model zapewnił najwyższą dokładność, osiągając lepsze wyniki zarówno od modelu wykorzystującego wyłącznie dane ACS, jak i od modelu opartego wyłącznie na PDFM. Warto zwrócić uwagę na kilka wyników:
Wyniki te wskazują, że embeddingi modeli bazowych mogą wzbogacać tradycyjne modele poprzez wychwycenie ukrytych wzorców przestrzennych, których często brakuje w konwencjonalnych źródłach danych. Są one szczególnie przydatne w przypadku braku danych demograficznych, ich niskiej jakości lub konieczności ich uzupełnienia.
Prognozowanie całkowitej sprzedaży jest przydatne do zrozumienia szerszej sytuacji rynkowej, jednak firmy z sektora CPG często koncentrują się przede wszystkim na wynikach własnych produktów. W tym drugim przypadku użycia analizujemy prognozowanie sprzedaży jednego konkretnego produktu alkoholowego (Hawkeye Vodka) w poszczególnych obszarach ZIP Code Tabulation Area (ZCTA) w stanie Iowa.
Wykorzystując te same zbiory danych i podejście do modelowania co w poprzednim przykładzie, sprawdziliśmy, jak różne typy danych wejściowych sprawdzają się w tym bardziej szczegółowym zadaniu, skoncentrowanym na poziomie konkretnej marki.

Co ciekawe, embeddingi PDFM osiągnęły nieco lepsze wyniki niż dwa pozostałe modele, potwierdzając kluczowy wniosek: różne zadania predykcyjne wymagają różnych typów danych. Embeddingi modeli bazowych są szczególnie skuteczne w modelowaniu konkretnych zachowań konsumenckich oraz popytu na poziomie pojedynczych produktów, dlatego stanowią wartościowe uzupełnienie każdego procesu analityki przestrzennej.
Dzięki embeddingom Google PDFM dostępnym teraz w CARTO Workflows, wzbogacanie modeli przestrzennych o wielowymiarowe, wstępnie wytrenowane funkcje geoprzestrzenne jest łatwiejsze niż kiedykolwiek. Analitycy i zespoły ds. danych mogą z łatwością integrować te zaawansowane reprezentacje przestrzenne z modelami predykcyjnymi – bez konieczności kodowania. Niezależnie od tego, czy analizujesz popyt w handlu detalicznym, potrzeby infrastrukturalne, czy segmentację rynku, ten nowy element otwiera drogę do bardziej elastycznego i skalowalnego modelowania.
Wraz z dalszym rozwojem modeli bazowych tego typu integracje będą odgrywać kluczową rolę w zwiększaniu dostępności, skalowalności i praktycznego znaczenia spatial AI.
Autor: Miguel Álvarez i Lucía García-Duarte
Tłumaczenie: OPGK Rzeszów