Transmisja online
Szóstego Kongresu Statystyki Polskiej (Warszawa 1-2 lipca 2026 r.)
Dzień 2 (Sala D, 2 lipca)
Sesja 15
Statystyka społeczna, demografia
Metodologiczne wyzwania badań demograficznych
Organizator sesji: Elżbieta Gołata
Moderator sesji: Hanna Strzelecka
-
Cel
Celem referatu jest identyfikacja i analiza wyzwań kontroli ujawniania danych statystycznych prezentowanych w postaci macierzy przepływów (np. migracji wewnętrznych na pobyt stały, dojazdów do pracy, dojazdów do szkół). Główna hipoteza badawcza głosi, że publikacja tego rodzaju danych — w szczególności z ujawnieniem zerowych wartości przepływów — stanowi poważne ryzyko ujawnienia tych przekrojów, które w intencji autorów badania zostały ukryte (cell suppression). Dodatkowe udostępnianie danych dla wyższych poziomów podziału terytorialnego może zwiększyć ryzyko ujawnienia ukrytych informacji.
Metody
Badanie przeprowadzono na udostępnionych rzeczywistych danych statystyki publicznej, dotyczących migracji wewnętrznych na pobyt stały, pozyskanych z zasobów Głównego Urzędu Statystycznego (Baza Demografia). Analizą objęto przepływy na poziomie gmin, powiatów, podregionów i województw, co pozwoliło na ocenę zmian ryzyka ujawnienia w zależności od dostępności poziomu agregacji przestrzennej. Zastosowano metody z zakresu statystycznej kontroli ujawniania danych statystycznych (Statistical Disclosure Control, SDC), w tym analizę komórek wrażliwych według reguły dominacji (n, k), analizę komórek zerowych jako potencjalnych nośników informacji, a także badanie wzajemnych zależności między komórkami w macierzy. Zaproponowano formalizację problemu zerowych przepływów, wskazując na mechanizm, w którym agregacja do wyższych poziomów przestrzennych ujawnia dodatkowe informacje na temat przepływów na niższym poziomie agregacji danych. Osobno potraktowano problem niebezpiecznych zer, które — choć formalnie nieobecne w zbiorze komórek wrażliwych — mogą w połączeniu z wiedzą pomocniczą intruza prowadzić do naruszenia poufności danych na poziomie przepływów jednostkowych. W analizach wykorzystano autorskie programy napisane w języku R.
Wyniki
Przeprowadzona analiza na danych dotyczących międzygminnych migracji na pobyt udostępnionych w bazie Demografia stały wykazała, że zera w macierzy przepływów nie są informacyjnie neutralne — ich obecność jednoznacznie wskazuje na nieistnienie określonych relacji między jednostkami, co w połączeniu z dodatkowymi danymi zewnętrznymi może umożliwić pośrednią identyfikację ukrytych przekrojów. Co istotne, dostęp do pełnych danych na wyższym poziomie agregacji przestrzennej (powiaty, podregiony, województwa) zwiększa ryzyko ujawnienia: suma przepływów dla większych jednostek pozwala dodatkowo zrekonstruować dane na poziomie międzygminnym.
Wnioski
Wyniki wskazują na konieczność opracowania dedykowanych procedur metod kontroli ujawniana danych statystycznych dla danych prezentowanych w postaci macierzy przepływów. Procedury te powinny uwzględniać zarówno informacyjną rolę zer, jak i zależności hierarchiczne między poziomami agregacji przestrzennej. Istniejące standardy ochrony poufności w statystyce publicznej nie obejmują w wystarczającym stopniu specyfiki danych prezentowanych w postaci macierzy przepływów. Referat wskazuje kierunki dalszych prac.
Słowa kluczowe:
Kontrola ujawniania danych, macierze przepływów, zerowe przepływy, ukrywanie pierwotne, wykorzystanie danych zagregowanych
Pobierz prezentację (docx, 20 kB)Objective
The aim of the paper is to identify and analyse statistical disclosure control challenges for data presented as flow matrices (e.g. permanent internal migration, commuting to work, commuting to school). The main research hypothesis states that publishing such data — in particular with zero-valued flows disclosed — poses a serious risk of revealing cross-sections intended for suppression (cell suppression). The additional release of data at higher levels of territorial disaggregation may further increase this risk.
Methods
The study was conducted on real public statistics data concerning permanent internal migration, obtained from the resources of Statistics Poland (Demografia Database). The analysis covered flows at the level of communes, districts, subregions and voivodeships, allowing for a comprehensive assessment of how disclosure risk varies with the availability of different spatial aggregation levels. Methods from the field of Statistical Disclosure Control (SDC) were applied, including the analysis of sensitive cells based on the dominance rule (n, k), the analysis of zero cells as potential carriers of information, and the examination of interdependencies between cells within the matrix. A formalisation of the zero-flow problem was proposed, identifying the mechanism by which aggregation to higher spatial levels reveals additional information about flows at lower levels of data aggregation. The problem of dangerous zeros was treated separately — cells which, although formally absent from the set of sensitive cells, may in combination with an intruder`s auxiliary knowledge lead to a breach of data confidentiality at the level of individual flows. All analyses were carried out using custom programs written in the R language.
Results
The analysis conducted on data concerning inter-communal permanent migration, available in the Demografia database, demonstrated that zeros in the flow matrix are not informationally neutral — their presence unambiguously indicates the absence of specific relations between units, which in combination with additional external data may enable the indirect identification of suppressed cells. Importantly, access to complete data at a higher level of spatial aggregation (districts, voivodeships) increases the disclosure risk: the aggregated flows for larger territorial units allow for the additional reconstruction of data at the inter-communal level.
Conclusions
The results indicate the need to develop dedicated statistical disclosure control procedures for data presented in the form of flow matrices. Such procedures should account for both the informational role of zeros and the hierarchical dependencies between spatial aggregation levels. Existing confidentiality protection standards in official statistics do not sufficiently address the specific characteristics of data presented as flow matrices. The paper outlines possible directions for further research.
Keywords
statistical disclosure control, flow matrices, zero flows, primary suppression, aggregated data utilization.
-
Cel
Celem projektu LabFam Individual Biographies jest zwiększenie reprodukowalności i porównywalności badań z zakresu nauk społecznych poprzez stworzenie otwartej, zharmonizowanej bazy biografii rodzinnych i zawodowych. Badanie odpowiada na pytanie, w jaki sposób można odtworzyć spójne przebiegi płodności, partnerstwa i zatrudnienia w pięciu długookresowych panelach tak, aby umożliwić analizy przebiegu życia w ujęciu międzynarodowym.
Metody
Badanie opiera się na harmonizacji danych z pięciu wieloletnich badań panelowych: HILDA (Australia), SOEP (Niemcy), SHP (Szwajcaria), BHPS / UKHLS (Wielka Brytania) oraz PSID (USA). Dla każdej bazy odtworzono indywidualne biografie w trzech domenach: dzietności, partnerstwa i zatrudnienia. Wykorzystano dane z kwestionariuszy głównych, modułów kalendarzowych oraz komponentów retrospektywnych, co pozwoliło odzyskać zdarzenia zachodzące między falami badania i przed wejściem respondenta do panelu. Wyniki zapisano w postaci datowanych epizodów ze zdefiniowanym początkiem i końcem, umożliwiających analizy trwania i przejść między stanami. Harmonizacja obejmowała ujednolicenie definicji zmiennych, rozstrzyganie konfliktów między źródłami oraz wybór informacji najbliższej czasowo badanemu epizodowi. W obszarze zatrudnienia przyjęto wspólną klasyfikację statusów rynku pracy, a dla nakładających się informacji stosowano hierarchię stanów. Cały proces zaimplementowano w języku R jako otwarty, modułowy kod, który użytkownik może odtworzyć, dostosować do wybranych krajów, okresów i domen oraz łączyć z innymi infrastrukturami, np. CPF / CNEF. Procedury walidacyjne obejmowały porównania z miarami wyznaczanymi z badań źródłowych oraz z zewnętrznymi statystykami demograficznymi i rynku pracy.
Wyniki
W efekcie powstała otwarta infrastruktura danych umożliwiająca rekonstrukcję porównywalnych, indywidualnych historii płodności, partnerstwa i zatrudnienia dla pięciu krajów. Walidacja wewnętrzna i zewnętrzna pokazała wysoką zgodność wskaźników wyprowadzonych z LIB z danymi referencyjnymi, m.in. dla bezdzietności, wieku przy urodzeniu dziecka, wieku przy pierwszym małżeństwie oraz aktywności zawodowej kobiet i mężczyzn. Niewielkie odchylenia dotyczyły głównie wybranych kohort i baz, co potwierdza ogólną rzetelność oraz porównywalność zharmonizowanych biografii. Największą zgodność obserwowano dla SOEP, SHP oraz BHPS / UKHLS, natomiast większe różnice pojawiały się przede wszystkim w PSID oraz w najmłodszych lub najstarszych kohortach.
Wnioski
LIB obniża koszty przygotowania danych do analiz porównawczych i wzmacnia transparentność badań nad przebiegiem życia. Otwarty kod umożliwia pełną reprodukcję wyników, kontrolę decyzji harmonizacyjnych i dalsze rozwijanie bazy przez użytkowników. Projekt wnosi do literatury narzędzie pozwalające łączyć perspektywę rodzinną i zawodową w analizach międzynarodowych oraz ułatwia badanie zależności między niepewnością zatrudnienia, formowaniem związków, rodzicielstwem i wycofywaniem się z rynku pracy.
Słowa kluczowe:
harmonizacja danych, reprodukowalność badań
Pobierz prezentację (docx, 18 kB)Objective
The LabFam Individual Biographies project aims to enhance reproducibility and comparability in social science research by developing an open, harmonized database of family and employment biographies. It focuses on reconstructing consistent fertility, partnership, and employment trajectories across five long-running panel surveys. By integrating multiple data sources and aligning life-course information across countries, the project enables robust cross-national analyses of life-course dynamics.
Methods
The study is based on the harmonization of data from five long-running panel surveys: HILDA (Australia), SOEP (Germany), SHP (Switzerland), BHPS / UKHLS (United Kingdom), and PSID (United States). For each dataset, individual biographies were reconstructed in three domains: fertility, partnership, and employment. Data from core questionnaires, calendar modules, and retrospective components were used to recover events occurring between survey waves and prior to panel entry. The results are stored as dated spells with clearly defined starts and ends, enabling analyses of durations and transitions between states. Harmonization included standardizing variable definitions, resolving inconsistencies across sources, and prioritizing information closest in time to the observed episode. In the employment domain, a common classification of labor market statuses was applied, and overlapping information was resolved using a hierarchical ordering of states. The entire process was implemented in R as open, modular code that users can reproduce, customize by country, period, and domain, and link to other infrastructures such as CPF / CNEF. Validation procedures included comparisons with indicators derived from source surveys and external demographic and labor market statistics.
Results
The project resulted in an open data infrastructure enabling the reconstruction of comparable individual histories of fertility, partnership, and employment across five countries. Internal and external validation showed a high level of consistency between LIB-derived indicators and benchmark data, including measures of childlessness, age at childbirth, age at first marriage, and labor force participation of women and men. Minor discrepancies were mainly limited to specific cohorts and datasets, confirming the overall reliability and comparability of the harmonized biographies. The highest consistency was observed for SOEP, SHP, and BHPS / UKHLS, while larger deviations appeared primarily in PSID and in the youngest or oldest cohorts.
Conclusions
LIB reduces the costs of data preparation for comparative analyses and enhances transparency in life-course research. Its open-source and modular code ensures full reproducibility, makes harmonization decisions explicit, and allows users to adapt and extend the framework to their needs. By providing harmonized, spell-based histories, the project offers a tool that integrates family and employment perspectives in cross-national analyses and supports research on the interplay between employment uncertainty, partnership formation, childbearing, and labor market withdrawal.
Keywords
data harmonization, research reproducibility
-
Cel
Badanie aktywności ekonomicznej ludności spotyka się w trakcie swojej realizacji z nowymi wyzwaniami, oczekiwaniami i wymaganiami. Wynikają one ze zmian potrzeb oraz oczekiwań użytkowników, wymagań regulowanych przez przepisy prawne (np. nowe rozporządzenie ramowe dotyczące europejskiej statystyki społecznej), jak również okoliczności realizacji badania (np. pandemia COVID-19). Referat przedstawia zmiany w sposobie wyznaczania wag uogólniających BAEL wprowadzane od 2020 roku do chwili obecnej, których motywacja dotyczy wszystkich wspomnianych wyżej czynników.
Metody
Prezentowane działania, mające na celu sprostanie przedstawionym wyżej wyzwaniom, dotyczą zmian w sposobie wyznaczania wag uogólniających. Podstawową metodą jest kalibracja – metody oraz warunki kalibracyjne zostały zmienione na bardziej adekwatne lub wprowadzono kalibrację tam, gdzie nie była dotąd stosowana. Jeśli idzie o wagi indywidualne, zmiana polegała przede wszystkim na przejściu z post-stratyfikacji na bardziej ogólną kalibrację, co pozwoliło uwzględnić więcej warunków kalibracyjnych, m.in. lepiej odpowiadając na potrzeby użytkowników. Warunki kalibracyjne zostały rozszerzone w zakresie oszacowań regionalnych. Wprowadzono warunki dotyczące tygodnia referencyjnego, poprawiając reprezentatywność w czasie, co jest szczególnie istotne w przypadku nierównomiernie rozłożonych w kwartale zakłóceń realizacji wywiadów (jak to miało miejsce w pandemii). W przypadku wag gospodarstw domowych specyficznym problemem są konsekwencje akceptowania w badaniu częściowych jednostkowych braków odpowiedzi, tj. sytuacji, gdy odmowa udziału w wywiadzie indywidualnym dotyczy części członków gospodarstwa domowego. Wagi były wcześniej wyznaczane jako średnia wag członków gospodarstw i nie pozwalały na uzyskanie uogólnień spójnych z uogólnieniami indywidualnymi. Zmieniono sposób traktowania niepełnych wywiadów przy wyznaczaniu wag gospodarstw oraz wprowadzono kalibrację, która zapewnia zgodność z uogólnieniami indywidualnymi.
Wyniki
Wprowadzenie uogólnionej kalibracji wag indywidualnych pozwoliło zapewnić kontrolowaną jakość uogólnień w zakresie większej liczby przekrojów odpowiadających potrzebom użytkowników, unikając jednocześnie problemów z liczebnością próby w zbyt małych warstwach post-stratyfikacyjnych, co negatywnie rzutowało na stabilność wag i jakość uogólnień. Zastosowanie warunków dotyczących tygodnia referencyjnego zapewnia równą reprezentację wszystkich tygodni kwartału i eliminuje wrażliwość wyników na zmienność wielkości próby zrealizowanej w poszczególnych tygodniach (potencjalne obciążenie). Osiągnięto spójność oszacowań uzyskiwanych przy użyciu wag gospodarstw domowych z oszacowaniami indywidualnymi w zakresie podstawowych przekrojów, w tym dotyczących statusu aktywności ekonomicznej.
Wnioski
Zmiany metodologiczne pozwoliły spełnić wymogi wynikające z rozporządzenia ramowego oraz oczekiwań Euorstatu (przede wszystkim w odniesieniu do wag i uogólnień dotyczących gospodarstw domowych), poprawić jakość danych wynikowych oraz ich użyteczność z punktu widzenia potrzeb użytkowników. Zamiana w sposobie wyznaczania wag gospodarstw domowych ułatwia prowadzenie analiz, które wymagają uwzględnienia powiazań między członkami gospodarstwa, a także poprawia spójność ich wyników. Rozwiązania dotyczące kalibracji ze względu na tydzień referencyjny (czas) lub postępowania z niekompletnymi wywiadami gospodarstwa domowego mogą znaleźć szersze zastosowanie.
Słowa kluczowe:
aktywność ekonomiczna ludności, BAEL, wagi uogólniające, estymacja, kalibracja
Pobierz prezentację (docx, 19 kB)Objective
The Polish Labour Force Survey (BAEL) is facing new challenges, expectations, and requirements. These stem from changing user needs and expectations, legal requirements (e.g., the new framework regulation on European social statistics), and the circumstances of fieldwork (e.g., the COVID-19 pandemic). The paper presents the changes to the way of calculation of estimation weights in the Polish LFS implemented from 2020 to the present, driven by all the factors mentioned above.
Methods
The presented actions, aimed at addressing the challenges mentioned above, involve changes in the methodology of weighting (estimation). The primary method is a calibration – calibration methods and conditions have been changed to more appropriate ones, or calibration has been introduced where it was not previously used. Regarding individual weights, the change primarily involved a shift from a simple post-stratification to a general calibration, which allowed for the inclusion of more calibration conditions to, among other things, better meet user needs. Calibration conditions have been expanded for regional estimates. Reference week conditions have been introduced, improving representativeness over time, which is particularly important in the case of unevenly distributed in time disturbances in the interviewing process (as was the case during the pandemic). In the case of household weights, a specific problem is the consequence of accepting partial unit non-responses in the survey, i.e., situations where the refusal to participate in an individual interview concerns some household members. Household weights were previously calculated as an average of household member weights and did not allow for estimates consistent with the individual estimates. The treatment of incomplete interviews in calculating household weights has been changed, and a calibration has been introduced to ensure consistency with the individual estimates.
Results
The introduction of general calibration for calculating individual weights allowed for controlled quality of estimates for a larger number of cross-sections meeting user needs, while also avoiding sample size problems in too small post-stratification strata, which negatively impacted the stability of the weights and the quality of estimates. The use of reference week based conditions ensures equal representation of all weeks of the quarter and eliminates the sensitivity of the results to variations in sample size across weeks (potential bias). Consistency was achieved between the estimates obtained using household weights and individual estimates for the basic cross-sections, including economic activity status.
Conclusions
The methodological changes allowed us to meet the requirements of the framework regulation and Eurostat`s expectations (primarily regarding weights and estimates for households), improve the quality of results, and enhance their usefulness for user needs. The change in the calculation of household weights facilitates analyses that require consideration of relationships between household members and improves the consistency of their results. The solutions for calibration with respect to reference week (time) or for dealing with incomplete household interviews may find wider application.
Keywords
Labour Force Survey, weighting, estimation, calibration
-
Cel
Celem badania jest identyfikacja ukrytych czynników determinujących lata życia w zdrowiu (HLY) w wybranych krajach Unii Europejskiej oraz ocena, w jakim stopniu kierunki maksymalnej zmienności determinant zdrowotnych pokrywają się z kierunkami o najwyższej mocy predykcyjnej dla HLY. Zasadnicze pytanie badawcze brzmi: Czy nadzorowana redukcja wymiarów (PLS) daje przewagę nad nienadzorowaną (PCR) w warunkach silnej współliniowości i ograniczonej liczby obserwacji panelowych?
Metody
Zastosowano dwie metody redukcji wymiarów: regresję składowych głównych (PCR) oraz regresję częściowych najmniejszych kwadratów (PLS). PCR jest procedurą nienadzorowaną, w której dekompozycję spektralną macierzy korelacji zmiennych objaśniających poprzedza estymacja OLS na wybranych składowych. PLS, w odróżnieniu od PCR, maksymalizuje kowariancję między X a Y (algorytm NIPALS), co czyni ją metodą nadzorowaną. Próba liczy 120 obserwacji panelowych: 6 krajów (Austria, Dania, Niemcy, Włochy, Polska, Hiszpania) × 2 płcie × 10 lat (2015-2024). Zmienna zależna (HLY) i 10 determinant zdrowotnych (zanieczyszczenie powietrza, edukacja, deprywacja materialna, wydatki socjalne, gęstość zaludnienia, łóżka szpitalne, lekarze, alkohol, palenie, otyłość) pochodzą z Eurostatu, Banku Światowego i WHO. Liczbę składowych dobrano kryterium Kaisera, analizą równoległą Horna oraz walidacją krzyżową LOOCV minimalizującą RMSEP. Adekwatność próby do PCA potwierdzono testami KMO i Bartletta. Modele rozszerzono o efekty stałe dla krajów oraz zmienną binarną COVID-19. Porównanie metod oparto na: (a) RMSEP z LOOCV, (b) sparowanym teście różnic kwadratów reszt (typu Diebolda–Mariano), (c) korelacji ładunków PCA z wagami PLS, (d) bootstrapowych przedziałach ufności (B=500). Obliczenia wykonano w R z pakietami pls, psych, factoextra i car.
Wyniki
PCR osiąga RMSEP=2,872 przy 7 składowych, podczas gdy PLS uzyskuje porównywalne RMSEP=2,856 już przy 2 składowych. Test sparowany różnic kwadratów reszt nie wykazał istotnych różnic predykcyjnych (p=0,925). Niska korelacja ładunków PCA i wag PLS (r=0,262) potwierdza, że kierunki maksymalnej wariancji X nie pokrywają się z kierunkami o najwyższej mocy predykcyjnej. W modelu PCR z efektami stałymi istotne są dopiero PC5 i PC6 (nie PC1–PC3 absorbujące 73,9% wariancji). PCR+FE: R2=0,803 przy 14 parametrach: PLS+FE: R2=0,762 przy 9. Bootstrap (B=500) potwierdził istotność 8 z 10 współczynników PLS.
Wnioski
Wyniki wskazują, że przy silnej współliniowości i ograniczonym stosunku n / p metoda PLS oferuje przewagę parsymoniczną nad PCR, osiągając porównywalną dokładność predykcyjną przy 3,5-krotnie mniejszej liczbie składowych. Podejście panelowe (pooled) eliminuje niestabilność estymacji typową dla analiz per-country (n / p=1:1). Zidentyfikowano odmienne profile determinant HLY: u mężczyzn dominują czynniki behawioralno-środowiskowe, u kobiet socjoekonomiczne. Wkładem do literatury jest formalne porównanie PCR i PLS na panelowych danych HLY oraz wykazanie, że standardowe kryteria selekcji składowych (Kaiser, Horn) mogą być nieoptymalne dla celów predykcyjnych.
Słowa kluczowe:
lata życia w zdrowiu (HLY): regresja na składowych głównych (PCR): regresja częściowych najmniejszych kwadratów (PLS): redukcja wymiarów: dane panelowe
Pobierz prezentację (pdf, 1689 kB)Objective
The aim of the study is to identify the latent factors determining Healthy Life Years (HLY) in selected European Union countries and to assess the extent to which the directions of maximum variability in the set of health determinants coincide with the directions of highest predictive power for HLY. The central research question is: does supervised dimension reduction (PLS) offer an advantage over unsupervised reduction (PCR) under conditions of strong multicollinearity and a limited number of panel observations?
Methods
Two dimension reduction methods are applied: Principal Component Regression (PCR) and Partial Least Squares Regression (PLS). PCR is an unsupervised procedure in which a spectral decomposition of the correlation matrix of explanatory variables precedes OLS estimation on the selected components. PLS, in contrast to PCR, maximises the covariance between X and Y (NIPALS algorithm), which makes it a supervised method. The sample comprises 120 panel observations: 6 countries (Austria, Denmark, Germany, Italy, Poland, Spain) × 2 sexes × 10 years (2015-2024). The dependent variable (HLY) and 10 health determinants (air pollution, education, material deprivation, social protection expenditure, population density, hospital beds, physicians, alcohol consumption, smoking, obesity) are drawn from Eurostat, the World Bank and WHO. The number of components is selected via the Kaiser criterion, Horn`s parallel analysis and Leave-One-Out Cross-Validation (LOOCV) minimising RMSEP. Sample adequacy for PCA is confirmed by KMO and Bartlett tests. The models are extended with country fixed effects and a binary COVID-19 dummy. Method comparison is based on: (a) LOOCV RMSEP, (b) a paired test on squared LOO residuals (Diebold–Mariano style), (c) the correlation between PCA loadings and PLS weights, (d) bootstrap confidence intervals (B=500). All computations are performed in R using the pls, psych, factoextra and car packages.
Results
PCR attains RMSEP=2.872 with 7 components, while PLS achieves a comparable RMSEP=2.856 with only 2 components. The paired test on squared residuals reveals no significant difference in predictive accuracy (p=0.925). The low correlation between PCA loadings and PLS weights (r=0.262) confirms that the directions of maximum variance in X do not coincide with the directions of highest predictive power. In the PCR model with fixed effects, only PC5 and PC6 are significant (not PC1–PC3, which absorb 73.9% of the variance). PCR+FE: R2=0.803 with 14 parameters: PLS+FE: R2=0.762 with 9. Bootstrap (B=500) confirmed the significance of 8 out of 10 PLS coefficients.
Conclusions
The results indicate that under strong multicollinearity and a limited n / p ratio, PLS offers a clear parsimony advantage over PCR, attaining comparable predictive accuracy with 3.5 times fewer components. The pooled panel approach eliminates the estimation instability typical of per-country analyses (n / p=1:1). Distinct profiles of HLY determinants are identified: behavioural-environmental factors dominate for men, while socio-economic factors prevail for women. The contribution to the literature is a formal comparison of PCR and PLS on panel HLY data and the demonstration that standard component selection criteria (Kaiser, Horn) may be suboptimal for predictive purposes.
Keywords
Healthy Life Years (HLY): Principal Component Regression (PCR): Partial Least Squares (PLS): dimension reduction: panel data
Sesja 19
Zrozumieć dane: jak GUS buduje komunikację w erze informacji
Nowa strategia komunikacji GUS
Organizator sesji: Krzysztof Jedlak, Marek Pieniążek
Moderator sesji: Krzysztof Jedlak, Marek Pieniążek
Panel dyskusyjny: Nikodem Chinowski, Krzysztof Jedlak, Patrycja Sikora, Sebastian Stodolak
Sesja 23
Statystyka gospodarcza
Wybrane problemy statystyki gospodarczej
Organizator sesji: Eugeniusz Gatnar
Moderator sesji: Eugeniusz Gatnar
-
Cel
Celem badania jest ocena wpływu zmian liczby cudzoziemców na sytuację ekonomiczno-gospodarczą wybranych powiatów w Polsce w warunkach rosnącej i przestrzennie zróżnicowanej skali migracji po 2019 roku. Analiza wykorzystuje koncepcję „powiatów skojarzonych”, opartą na dopasowaniu jednostek o podobnych charakterystykach w roku bazowym, co pozwala ograniczyć wpływ różnic początkowych i umożliwia bardziej wiarygodne porównanie zmian w czasie.
Metody
W badaniu wykorzystywane są oraz będą dane z systemu OBM oraz Banku Danych Lokalnych (BDL GUS), obejmujące informacje o sytuacji społeczno-ekonomicznej powiatów oraz dane o liczbie i rozmieszczeniu cudzoziemców w Polsce. Analizy są w trakcie realizacji i będą dalej rozwijane w języku R, z wykorzystaniem narzędzi do przetwarzania danych, analizy statystycznej oraz procedur dopasowania jednostek. Kluczowym elementem metodologicznym jest konstrukcja „powiatów skojarzonych”, czyli par jednostek terytorialnych tworzonych na podstawie podobieństwa ich charakterystyk w roku 2019. Procedura dopasowania jest obecnie implementowana i testowana – do wyznaczania podobieństwa wykorzystywana jest miara odległości euklidesowej (z możliwością zastosowania alternatywnych specyfikacji), a jej celem jest minimalizacja globalnej odległości pomiędzy sparowanymi powiatami. Wstępnie wyodrębniono dwie grupy jednostek: 10 powiatów o najwyższej liczbie cudzoziemców oraz 10 powiatów o najniższej ich liczbie. Ostateczna konstrukcja par oraz ich walidacja są w toku. Takie podejście ma pozwolić na kontrolę początkowych różnic strukturalnych i bardziej precyzyjną ocenę zmian w czasie, w szczególności w okresie 2019–2024 (oraz częściowo 2025, w zależności od dostępności danych).
Wyniki
Dotychczasowe, wstępne analizy wskazują na możliwe zróżnicowanie tempa zmian sytuacji ekonomiczno-gospodarczej w badanych powiatach w zależności od poziomu obecności cudzoziemców. Obserwowane są sygnały sugerujące odmienne trajektorie zmian wybranych wskaźników pomiędzy powiatami o wysokiej i niskiej koncentracji cudzoziemców, jednak wyniki te wymagają dalszej weryfikacji i pogłębionej analizy. Podejście oparte na „powiatach skojarzonych” jest obecnie oceniane pod kątem swojej użyteczności w ograniczaniu wpływu różnic początkowych i lepszym uchwyceniu potencjalnych zależności pomiędzy migracją a zmianami społeczno-ekonomicznymi.
Wnioski
Zastosowane podejście ma potencjał umożliwienia bardziej precyzyjnej analizy wpływu zmian liczby cudzoziemców na sytuację lokalnych gospodarek, jednak na obecnym etapie badania wnioski mają charakter wstępny. Dalsze prace będą obejmować rozwinięcie analiz oraz zastosowanie bardziej zaawansowanych metod ekonometrycznych. Ostateczne wyniki mogą stanowić wkład do literatury dotyczącej ekonomii regionalnej oraz analiz migracyjnych, a także znaleźć zastosowanie w politykach publicznych na poziomie lokalnym. Praca ma charakter eksploracyjny i stanowi punkt wyjścia do dalszych badań.
Słowa kluczowe:
analiza przestrzenna, cudzoziemcy, powiaty skojarzone.
Pobierz prezentację (pdf, 9947 kB)Objective
The aim of the study is to assess the impact of changes in the number of foreign nationals on the economic situation of selected counties in Poland in the context of the growing and spatially differentiated scale of migration after 2019. The analysis employs the concept of “matched counties,” based on pairing units with similar characteristics in the base year, which allows for reducing the influence of initial differences and enables more reliable comparisons over time.
Methods
The study uses data from the OBM system and the Local Data Bank of Statistics Poland (BDL GUS), including information on the socio-economic situation of counties as well as data on the number and distribution of foreign nationals in Poland. The analyses are currently ongoing and are being further developed in R, using tools for data processing, statistical analysis, and matching procedures. A key methodological element is the construction of “matched counties,” i.e., pairs of territorial units formed based on the similarity of their characteristics in 2019. The matching procedure is currently being implemented and tested. Similarity is measured using the Euclidean distance (with possible alternative specifications), with the objective of minimizing the overall distance between paired counties. Two groups of units have been preliminarily identified: 10 counties with the highest and 10 with the lowest number of foreign nationals. The final construction and validation of pairs are still in progress. This approach allows for controlling initial structural differences and provides a more precise assessment of changes over time, particularly in the period 2019–2024 (and partially 2025, depending on data availability).
Results
Preliminary findings indicate potential differences in the pace of changes in the economic situation of the analyzed counties depending on the level of foreign population presence. There are signals suggesting distinct trajectories of selected indicators between counties with high and low concentrations of foreign nationals: however, these results require further verification and more in-depth analysis. The “matched counties” approach is currently being evaluated in terms of its effectiveness in reducing the impact of initial differences and better capturing potential relationships between migration and socio-economic changes.
Conclusions
The applied approach has the potential to enable a more precise analysis of the impact of changes in the number of foreign nationals on local economies: however, at the current stage, the conclusions remain preliminary. Further work will involve extending the analysis and applying more advanced econometric methods. The final results may contribute to the literature on regional economics and migration studies, as well as inform public policy at the local level. The study is exploratory in nature and provides a foundation for further research
Keywords
spatial analysis, foreign nationals, matched counties
-
Cel
Celem głównym badań była ocena zależności między funkcjonalnym powiązaniem gmin wiejskich i miejsko-wiejskich z większymi ośrodkami miejskimi a poziomem inwestycji w gospodarkę niskoemisyjną, współfinansowanych ze środków UE w latach 2007–2013 oraz 2014–2020. Badania empiryczne przeprowadzono w celu weryfikacji hipotezy badawczej zakładającej, że „gminy funkcjonalnie powiązane z dużymi ośrodkami miejskimi (położone w granicach FUA) wykazują wyższy poziom inwestycji w rozwój gospodarki niskoemisyjnej niż gminy znajdujące się poza tymi obszarami”.
Metody
Zakres podmiotowy i terytorialny badań objął wszystkie gminy wiejskie i miejsko-wiejskie w Polsce – łącznie 2175 gmin. Źródłem danych o projektach współfinansowanych ze środków UE w obszarze „Gospodarka niskoemisyjna” była baza danych jednostkowych Ministerstwa Funduszy i Polityki Regionalnej. W badaniach wykorzystano również dane Głównego Urzędu Statystycznego (GUS), obejmujące Bank Danych Lokalnych oraz „Delimitację Obszarów Wiejskich” (DOW). Typologia ta umożliwia wyodrębnienie gmin według ich powiązań funkcjonalnych z ośrodkami miejskimi, dzieląc je na gminy aglomeracyjne i pozaaglomeracyjne. W pierwszym etapie badań analizie poddano liczbę i wartość pozyskanych projektów w obszarze gospodarki niskoemisyjnej (w ujęciu bezwzględnym, per capita, oraz per km2) przez gminy według klasyfikacji DOW i województwa. W tym etapie badań zastosowano metody statystyki opisowej oraz wnioskowania statystycznego, oparte na testach istotności różnic. W drugim etapie badań zastosowano analizę korespondencji, umożliwiającą graficzne odwzorowanie relacji między kategoriami zmiennych w przestrzeni dwuwymiarowej. Dane wejściowe miały postać tabeli kontyngencji obejmującej dwie zmienne: (1) typ gminy według przynależności do FUA i województwa (łącznie 32 jednostki) oraz (2) poziom inwestycji w gospodarkę niskoemisyjną. Zmienną ilościową dotyczącą poziomu inwestycji (na mieszkańca i jednostkę powierzchni) skategoryzowano do czterech klas opartych na kwartylach rozkładu.
Wyniki
Powiązania funkcjonalne badanych gmin z dużymi ośrodkami miejskimi istotnie różnicują ich aktywność inwestycyjną w zakresie rozwoju gospodarki niskoemisyjnej. Analiza korespondencji ujawniła wyraźne rozróżnienie między gminami aglomeracyjnymi a pozaaglomeracyjnymi, potwierdzając ważną rolę czynnika funkcjonalnego. Gminy w obrębie FUA częściej realizują inwestycje na poziomie umiarkowanym (niskim lub średnim), natomiast poza FUA dominują układy skrajne – od braku działań po wysoką intensywność. Układ ten odpowiada mechanizmom polaryzacji centrum–peryferie. Analiza miar dyspersji wskazuje, że gminy pozaaglomeracyjne charakteryzują się większym zróżnicowaniem poziomu inwestycji w gospodarkę niskoemisyjną.
Wnioski
W świetle uzyskanych wyników zasadne wydaje się sformułowanie kilku rekomendacji. Wskazane jest prowadzenie polityki rozwojowej o zróżnicowanym charakterze, dostosowanej do typu i lokalizacji gmin. Kluczowe znaczenie ma wzmacnianie potencjału instytucjonalnego gmin pozaaglomeracyjnych – zwłaszcza tych, które nie wykazują aktywności w zakresie transformacji energetycznej. Wymaga to nie tylko wsparcia finansowego, lecz także zapewnienia dostępu do doradztwa, wiedzy eksperckiej oraz uproszczenia procedur.
Słowa kluczowe:
inwestycje, gospodarka niskoemisyjna, transformacja energetyczna, funkcjonalne obszary miejskie (FUA), delimitacja obszarów wiejskich (DOW)
Pobierz prezentację (pdf, 1767 kB)Objective
The main objective of the study was to assess the relationship between the functional linkage of rural and urban-rural municipalities with larger urban centers and the level of investments in the low-emission economy, co-financed by EU funds in the periods 2007–2013 and 2014–2020. The empirical analysis was conducted to verify the research hypothesis that “municipalities functionally linked to large urban centers (located within Functional Urban Areas – FUA) exhibit a higher level of investment in the development of a low-emission economy than municipalities located outside these areas.”
Methods
The study covered all rural and urban-rural municipalities in Poland, totaling 2,175 units. Data on EU co-financed projects in the field of the low-emission economy were obtained from the individual project database of the Ministry of Funds and Regional Policy. The analysis also used data from Statistics Poland (GUS), including the Local Data Bank and the “Delimitation of Rural Areas” (DOW). This typology allows municipalities to be classified according to their functional linkages with urban centers, distinguishing between agglomeration and non-agglomeration municipalities. In the first stage, the number and value of low-emission economy projects acquired by municipalities were analyzed (in absolute terms, per capita, and per km2), according to the DOW classification and voivodeships. Descriptive statistics and statistical inference methods based on significance tests were applied. In the second stage, correspondence analysis was used to graphically represent relationships between variable categories in a two-dimensional space. The input data took the form of a contingency table including two variables: (1) the type of municipality according to its affiliation with FUA and voivodeship (32 units in total), and (2) the level of investment in the low-emission economy. The quantitative variable describing the level of investment (per capita and per area unit) was categorized into four classes based on distribution quartiles.
Results
The functional linkages of the analyzed municipalities with large urban centers significantly differentiate their investment activity in the development of the low-emission economy. Correspondence analysis revealed a clear distinction between agglomeration and non-agglomeration municipalities, confirming the key role of the functional factor. Municipalities within FUAs more often implement investments at a moderate level (low or medium), whereas outside FUAs extreme patterns dominate—from no activity to high intensity. This pattern reflects center–periphery polarization mechanisms. The analysis of dispersion measures indicates that non-agglomeration municipalities are characterized by greater variability in the level of low-emission investments.
Conclusions
Development policy should be differentiated and tailored to the type and location of municipalities. It is particularly important to strengthen the institutional capacity of non-agglomeration municipalities, especially those less active in the energy transition, through financial support, advisory services, and simplified procedures. At the same time, agglomeration municipalities should be encouraged to undertake more ambitious pro-climate actions, while continued support for peripheral areas should be maintained.
Keywords
investments, energy transition, low-emission economy, Functional Urban Areas (FUA), Delimitation of Rural Areas (DOW)
-
Cel
Celem badania jest identyfikacja siły, kierunku oraz zmienności w czasie oddziaływania cen producenta i cen importera na wskaźnik cen produktów żywnościowych w Polsce. Analiza obejmuje wybrane produkty roślinne i zwierzęce nieprzetworzone. Dodatkowym celem jest określenie, w jakich okresach inflacja cen żywności była determinowana przez zmiany cen producenta lub importera, a także ocena wzajemnych relacji i sprzężeń zwrotnych między tymi kategoriami cen w różnych horyzontach czasowych.
Metody
W badaniu zastosowano analizę falkową jako narzędzie umożliwiające jednoczesną analizę zależności w czasie i w dziedzinie częstotliwości. Podejście to pozwala na identyfikację zmiennych w czasie powiązań między dynamiką cen producenta, importera oraz W badaniu zastosowano analizę falkową jako narzędzie umożliwiające jednoczesną analizę zależności w czasie i w dziedzinie częstotliwości. Podejście to pozwala na identyfikację zmiennych w czasie powiązań między dynamiką cen producenta, importera oraz konsumenta, a także na określenie kierunku przepływu impulsów cenowych. W szczególności wykorzystano ciągłą transformację falkową oraz analizę koherencji falkowej do badania siły współzależności oraz przesunięć fazowych pomiędzy analizowanymi szeregami czasowymi. Dane empiryczne obejmują miesięczne indeksy cen dla Polski pochodzące z bazy Eurostatu „Food price monitoring tool” (https: / / doi.org / 10.2908 / PRC_FSC_IDX) i dotyczą okresu od stycznia 2005 roku do grudnia 2025 roku, przy czym liczba obserwacji różni się w zależności od produktu i dostępności danych (od n=180 do n=240). Analizie poddano wybrane produkty żywnościowe nieprzetworzone, zarówno pochodzenia roślinnego, jak i zwierzęcego. Uzupełnieniem badania jest wykonanie testu przyczynowości w sensie Grangera, aby potwierdzić wyniki analizy falkowa. W celu zapewnienia porównywalności zastosowano odpowiednie procedury wstępnego przygotowania danych, w tym dyskusję o filtrację składników sezonowych.
Wyniki
Uzyskane wyniki wskazują na istotne zróżnicowanie zależności pomiędzy cenami producenta, importera i konsumenta w zależności od rodzaju produktu. Analiza falkowa umożliwiła dekompozycję tych zależności na komponenty krótkookresowe, średniookresowe i długookresowe, ujawniając zmienność siły powiązań w czasie. W wielu przypadkach obserwuje się okresy dominacji wpływu cen producenta, szczególnie w długich cyklach, podczas gdy w krótszych horyzontach istotną rolę odgrywają ceny importera. Wyniki wskazują również na występowanie przesunięć fazowych, które pozwalają identyfikować opóźnienia w transmisji impulsów cenowych między analizowanymi kategoriami. Zróżnicowanie to jest szczególnie widoczne pomiędzy produktami roślinnymi i zwierzęcymi.
Wnioski
Zastosowanie analizy falkowej pozwala na pogłębioną ocenę mechanizmów kształtowania się cen żywności oraz identyfikację zmiennych w czasie relacji pomiędzy cenami producenta, importera i konsumenta. Wyniki wskazują, że proces transmisji cen ma charakter wieloskładnikowy i zależy od horyzontu czasowego oraz specyfiki produktu. Baza danych Eurostatu „Food price monitoring tool” stanowi wartościowe źródło informacji do tego typu analiz, umożliwiając badanie współzależności w ujęciu dynamicznym. Uzyskane rezultaty mogą być wykorzystane zarówno w analizach makroekonomicznych, jak i w formułowaniu polityki rolnej oraz żywnościowej.
Słowa kluczowe:
analiza falkowa, inflacja, HICP, ceny żywności, transmisja cen
Pobierz prezentację (pdf, 10575 kB)Objective
The objective of this study is to identify the strength, direction, and temporal variability of the impact of producer and importer prices on the food price index in Poland. The analysis covers selected unprocessed plant and animal products. An additional objective is to determine during which periods food price inflation was driven by changes in producer or importer prices, as well as to assess the interrelationships and feedback loops between these price categories across different time horizons.
Methods
The study employed wavelet analysis as a tool enabling the simultaneous analysis of relationships in both time and the frequency domain. This approach allows for the identification of time-varying relationships between the dynamics of producer, importer, and consumer prices, as well as for determining the direction of price impulse propagation. In particular, continuous wavelet transform and wavelet coherence analysis were used to examine the strength of interdependence and phase shifts between the analyzed time series. The empirical data include monthly price indices for Poland from Eurostat’s “Food price monitoring tool” database (https: / / doi.org / 10.2908 / PRC_FSC_IDX) and cover the period from January 2005 to December 2025, with the number of observations varying depending on the product and data availability (from n=180 to n=240). The analysis covers selected unprocessed food products, both of plant and animal origin. The study is supplemented by a Granger causality test to confirm the results of the wavelet analysis. To ensure comparability, appropriate data preprocessing procedures were applied, including the removal of seasonal components.
Results
The results indicate significant variation in the relationships between producer, importer, and consumer prices depending on the type of product. The wavelet analysis enabled the decomposition of these relationships into short-term, medium-term, and long-term components, revealing the variability of the strength of these relationships over time. In many cases, periods of dominance by producer prices are observed, particularly in long cycles, while importer prices play a significant role in shorter time horizons. The results also indicate the presence of phase shifts, which allow for the identification of delays in the transmission of price shocks between the analyzed categories. This differentiation is particularly evident between plant and animal products.
Conclusions
The use of wavelet analysis allows for an in-depth assessment of the mechanisms underlying food price formation and the identification of time-varying relationships between producer, importer, and consumer prices. The results indicate that the price transmission process is multifaceted and depends on the time horizon and the specific characteristics of the product. Eurostat’s “Food price monitoring tool” database is a valuable source of information for this type of analysis, enabling the examination of interdependencies in a dynamic context. The results obtained can be used both in macroeconomic analyses and in the formulation of agricultural and food policies.
Keywords
wavelet analysis, inflation, HICP, food prices, price transmission
-
Cel
Celem badania jest określenie, w jakim stopniu wzrost startupów technologicznych w Warszawie zależy od ich cech początkowych oraz od czynników lokalizacyjnych wewnątrz miasta – zarówno absolutnych (np. dostępność infrastruktury), jak i relatywnych (charakterystyka otoczenia i struktura sąsiedztwa). Badanie odpowiada na pytanie, czy znaczenie lokalizacji jest jednorodne, czy też zróżnicowane w zależności od profilu początkowego firmy.
Metody
Badanie opiera się na danych dotyczących startupów technologicznych zlokalizowanych w Warszawie, łączących informacje o ich cechach początkowych (m.in. wielkość, struktura kapitału, zasoby) oraz szczegółowych charakterystykach przestrzennych o ich kontekście wewnątrzmiejskim. W celu redukcji wymiarowości i identyfikacji głównych komponentów opisujących przestrzeń zastosowano analizę głównych składowych (PCA). Następnie wykorzystano modele uczenia maszynowego oparte na drzewach decyzyjnych (XGBoost), które umożliwiają uchwycenie nieliniowych zależności oraz interakcji pomiędzy zmiennymi. W odróżnieniu od klasycznych modeli ekonometrycznych podejście to pozwala analizować heterogeniczne efekty bez narzucania z góry ich struktury. Interpretacja wyników została przeprowadzona z wykorzystaniem narzędzi Explainable Artificial Intelligence (XAI), w szczególności miar ważności zmiennych oraz zależności częściowych (partial dependence). Pozwoliło to na identyfikację zarówno ogólnych wzorców, jak i zróżnicowanych efektów dla różnych typów firm, a także na rozróżnienie znaczenia czynników absolutnych i relatywnych w kontekście lokalizacji. .
Wyniki
Wyniki wskazują, że choć absolutne czynniki lokalizacyjne, takie jak dostępność infrastruktury, mają istotne znaczenie dla wzrostu startupów, to kluczową rolę odgrywają czynniki relatywne, związane z charakterystyką sąsiedztwa i lokalnymi efektami aglomeracji. Jednocześnie efekty te nie są jednorodne – ich siła i kierunek zależą od cech początkowych firm. Zaobserwowano istotną heterogeniczność efektów przestrzennych: niektóre startupy korzystają z lokalizacji w ścisłym centrum ośrodków aglomeracyjnych, podczas gdy inne osiągają lepsze wyniki w mniej konkurencyjnych obszarach. Wyniki podważają podejście oparte na efektach średnich i wskazują na konieczność uwzględniania interakcji między firmą a jej otoczeniem.
Wnioski
Badanie wnosi wkład do literatury poprzez integrację podejścia opartego na cechach firm i analizie przestrzennej w ramach jednego modelu empirycznego. Pokazuje, że efekty lokalizacji są silnie zróżnicowane i zależne od kontekstu, co ma istotne implikacje dla polityki gospodarczej oraz doradztwa dla przedsiębiorców. Zamiast uniwersalnych rekomendacji lokalizacyjnych, wyniki sugerują potrzebę podejścia dopasowanego do profilu firmy. Metodologicznie praca pokazuje również potencjał narzędzi uczenia maszynowego i XAI w analizie złożonych zależności przestrzennych.
Słowa kluczowe:
startupy technologiczne: lokalizacja działalności gospodarczej: efekty aglomeracji: uczenie maszynowe: analiza przestrzenna
Pobierz prezentację (pdf, 1859 kB)Objective
The study aims to assess to what extent the growth of technological startups operating in Warsaw is driven by their initial characteristics (initial capital endowment and its structure, number of employees, etc.) and by intra-urban location-related factors, both absolute (e.g. infrastructure accessibility) and relative (neighbourhood composition and local context). It addresses whether the impact of location is uniform, or varies depending on the initial profile of the firm.
Methods
The analysis is based on data on technological startups located in Warsaw, combining information on their initial characteristics (e.g. employee number, size, capital structure, initial financial resources and endowments) with detailed spatial indicators relating to their intra-urban location (here, both absolute and relative factors are considered, describing the neighbourhood environment, and absolute distance to the main city`s amenities). To reduce dimensionality and identify key components describing the spatial environment, Principal Component Analysis (PCA) is applied. Next, tree-based machine learning models (XGBoost) are used to capture non-linear relationships and interactions between variables. In contrast to standard econometric approaches, this framework allows for the identification of heterogeneous effects without imposing a predefined functional form. To support interpretation, Explainable Artificial Intelligence (XAI) tools are employed, including variable importance measures and partial dependence analysis. This enables the identification of both general patterns and differentiated effects across firm types, and allows to distinguish the role of absolute versus relative location factors in shaping startup growth.
Results
The results indicate that while absolute location factors, such as access to infrastructure and the main city`s amenities, are relevant for startup growth, relative factors linked to neighbourhood characteristics and local agglomeration play a more decisive role. At the same time, these effects are not uniform. A substantial degree of heterogeneity is observed: some startups benefit from being located in dense, competitive environments, while others perform better in less saturated areas. This suggests that the impact of spatial context depends strongly on initial firm characteristics and challenges approaches based on average effects.
Conclusions
The study contributes by integrating firm-level and intra-urban spatial perspectives within a single empirical framework and by explicitly addressing heterogeneity in location effects. The findings have implications for both policy and practice, suggesting that location strategies should be tailored to firm-specific profiles rather than based on general rules. From a methodological perspective, the study demonstrates the usefulness of machine learning and XAI tools in analysing complex spatial relationships and uncovering non-linear and context-dependent effects.
Keywords
technological startups, business location, agglomeration effects, machine learning, spatial analysis
Lista patronów
Patronat honorowy:
Patroni medialni:
