Metodologia i ograniczenia

Co dokładnie obserwujemy, czego nie widzimy i w których miejscach nasze liczby zależą od decyzji, które sami podjęliśmy.

Co około 5 minut zapisujemy kopię strony głównej 14 polskich portali — nazywamy ją zrzutem. To kod strony taki, jaki przysłał serwer portalu, nie obrazek z ekranu. Z każdego zrzutu spisujemy linki do artykułów i ich kolejność w kodzie (pozycję). Pobieramy same artykuły i wracamy do nich, żeby sprawdzić, czy się zmieniły (ciche edycje). Program AI grupuje artykuły z różnych portali o tym samym zdarzeniu (wydarzenia), a kilka wydarzeń składających się na jedną dłuższą sprawę łączy w Historię. Wszystko, co pokazujemy, wynika z tych kilku czynności. Poniżej opisujemy, gdzie każda z nich może zawieść.

Osobne strony opisują, jak działa AfterglowBot (jak oddzielamy pomiar od ocen AI i jakich zasad przestrzegamy przy zbieraniu) oraz stan zbierania danych (kiedy zbieranie działało, a kiedy nie).

1Ograniczenia w skrócie#

Mapa tej strony: co nie jest u nas pomiarem, czego nie gwarantujemy i gdzie o czymś zdecydowaliśmy sami. Każdy punkt prowadzi do sekcji, która to rozwija.

  • Widzimy tylko to, co portal pokazał w miejscach, które sprawdzamy (strona główna, wybrane działy, kanał RSS), nie całą jego publikację. co obserwujemy →
  • „Nie zaobserwowano” nie dowodzi, że czegoś nie było. Ten napis może znaczyć cztery różne rzeczy, w tym naszą własną przerwę w zbieraniu. cztery napisy o braku →
  • Ile portal naprawdę opublikował, nie mierzy nikt, my też nie. Mierzymy tylko, ile łapiemy z tego, co pokazał w sprawdzanych miejscach. czego nie widzimy → · stan zbierania per portal →
  • Każdy czas ma niepewność około jednego odstępu między zrzutami, czyli około 5 minut. Pierwsza i ostatnia obserwacja to granice, nie dokładny moment wejścia czy zejścia ze strony. dokładność czasowa →
  • „Pozycja” to kolejność linku w kodzie strony, nie na ekranie — i liczy każdy pasujący link, także z paska przewijanego czy dodatkowych okienek. co znaczy pozycja →
  • „Artykuł” rozpoznajemy po kształcie adresu, nie po treści. Sami nie odróżniamy zwykłego artykułu od wideo, galerii czy materiału sponsorowanego. co liczymy jako artykuł →
  • Próg zniknięcia (25 % zwykłego czasu) ustaliliśmy sami. Pokazujemy, jak zmieniłby się wynik przy innym progu. zniknięcia i ich próg → · przykład krok po kroku →
  • Grupowanie w wydarzenia i Historie to ocena programu AI, nie pomiar. Może się mylić; przy każdym wydarzeniu pokazujemy, jak bardzo była pewna. wydarzenia i Historie →
  • Dwa wątki tej samej sprawy bywają u nas niepołączone. niepołączone wątki →
  • Archiwum zaczyna się 27.06.2026. Temat, który u nas zaczyna się tego dnia, mógł trwać wcześniej. początek archiwum →

2Co obserwujemy#

Artykułów szukamy czterema drogami:

  1. Co około 5 minut pobieramy stronę główną i spisujemy linki do artykułów.
  2. To samo robimy z wybranymi przez nas działami portalu (np. Wiadomości, Biznes).
  3. Czytamy kanał RSS, czyli listę nowych artykułów, którą portal sam publikuje. To jedyna droga dla portali, których strona główna układa się dopiero w przeglądarce czytelnika — my pobieramy sam kod z serwera, a w nim listy artykułów jeszcze nie ma. U tych portali nie mierzymy pozycji.
  4. Wracamy do zapisanych zrzutów strony głównej i sprawdzamy, czy nie ma tam artykułu, który przy pierwszym przejściu nam umknął.

Regularnie sprawdzamy też, czy każdy artykuł widoczny w zrzutach ma już wpis w naszej bazie. Dla świeżych dni takich braków powinno być blisko zera — to nasz wskaźnik kontrolny, że nic nam nie ucieka z miejsc, które sprawdzamy.

3Czego nie widzimy#

Widzimy tylko to, co portal pokazał w tych czterech miejscach. To nie jest pełna kopia wszystkiego, co publikuje. Artykuł dostępny wyłącznie w aplikacji mobilnej, w wyszukiwarce portalu, w newsletterze albo w mediach społecznościowych u nas nie istnieje. Tak samo artykuł opublikowany i zdjęty między dwoma naszymi odwiedzinami.

W obu przypadkach nie potrafimy odróżnić „nie widzieliśmy” od „nie było”. Dlatego brak obserwacji nigdy nie jest dowodem, że czegoś nie było. Ten sam problem wraca przy zniknięciach — tam dotyczy artykułów, które raz złapaliśmy, a potem przestaliśmy widzieć.

Ile nam ucieka — co da się zmierzyć, a czego nie

Dwa pytania łatwo pomylić:

  • Ile łapiemy z tego, co portal pokazał w sprawdzanych miejscach? To mierzymy: porównujemy zrzuty strony głównej z tym, co mamy zapisane, i szukamy różnic. Wynik per portal jest na stronie stanu zbierania.
  • Jaką część wszystkiego, co portal opublikował, widzimy? Tego nie da się zmierzyć. Pełną listę swoich publikacji ma tylko sama redakcja, a jej nie udostępnia. Bez takiej listy każda liczba tego rodzaju — nasza czy cudza — jest szacunkiem. (W statystyce to pytanie nazywa się recall.)

4Co liczymy jako „artykuł”#

„Artykułem” jest dla nas każdy link, którego adres wygląda tak, jak dany portal buduje adresy swoich artykułów. Każdy portal robi to inaczej:

  • u jednego na końcu adresu stoi sam numer — …/artykul/12345678,
  • u innego kod doklejony po przecinku do tytułu — …/poruszajacy-list,7k3f9a2,
  • u innego kod w osobnym kawałku adresu — …/7l4bm4g/tytul.

Dla każdego z 14 portali mamy więc osobną regułę, dobraną na podstawie prawdziwych adresów z tego portalu. Gdzie osobnej reguły nie ma, stosujemy ogólną: ostatni kawałek adresu wygląda jak kod — 6–9 znaków, w tym co najmniej jedna litera i jedna cyfra.

To test kształtu adresu, nie treści. Nie sprawdzamy, czy pod adresem jest zwykły artykuł, relacja na żywo, wideo, galeria czy materiał sponsorowany — jeśli adres pasuje, liczymy. Materiał sponsorowany bez odrębnego kształtu adresu trafia do naszej bazy tak samo jak zwykły artykuł, bo nie ma w adresie ani na stronie nic, po czym dałoby się go odróżnić.

Mamy dwa ręcznie dodane wyjątki: relacje na żywo OKO.press i sportowy serwis WP działający pod osobnym adresem. Odnotowujemy, że pojawiły się na stronie głównej i na jakiej pozycji, ale nie zapisujemy ich jako osobnych artykułów. Poza tymi dwoma przypadkami typów treści nie odróżniamy.

Strony tagów, autorów i działów zwykle nie mają w adresie kawałka podobnego do kodu, więc ich nie łapiemy. To skutek reguły o kształcie adresu, nie osobne filtrowanie — adres, który przypadkiem pasuje kształtem, mógłby się prześlizgnąć.

5Co znaczy „pozycja”#

„Poz. 119 z 164” znaczy: w kodzie strony głównej z tego zrzutu link do artykułu był 119. z kolei spośród 164 linków do artykułów. Liczymy kolejność w kodzie, jaki przysłał serwer — nie kolejność, w jakiej czytelnik widzi je na ekranie, i nie żadną „ważność”.

Do 164 wliczamy tylko linki, które prowadzą do adresu w kształcie artykułu i mają tekst co najmniej 12 znaków — to odsiewa ikonki i podpisy typu „Wideo”, „Czytaj dalej”. Jeśli do jednego artykułu prowadzi kilka linków (np. zdjęcie i nagłówek), liczy się pierwszy.

Liczymy całą stronę, nie tylko główną kolumnę: link z paska przewijanego, z okienka „najczęściej czytane” czy z modułu wideo liczy się tak samo jak nagłówek, jeśli pasuje kształtem adresu. „Strona główna” to jeden adres — ten, który widać po wpisaniu nazwy portalu w przeglądarce — pobrany jako kod z serwera, bez uruchamiania skryptów. Portale, których strona główna układa się dopiero w przeglądarce, obserwujemy przez RSS i pozycji u nich nie mierzymy.

6Dokładność czasowa obserwacji#

Zrzuty robimy co około 5 minut. To ustala dokładność każdego czasu, jaki pokazujemy, nie tylko przy zniknięciach.

  • Gdy piszemy, że artykuł pojawił się o danej godzinie, naprawdę pojawił się gdzieś między poprzednim zrzutem a tym, w którym go zobaczyliśmy. Dokładniej nie wiemy.
  • Gdy piszemy, że artykuł był na stronie „co najmniej X”, X to czas od naszej pierwszej do ostatniej obserwacji. To dolna granica. Artykuł mógł pojawić się w każdej chwili od poprzedniego zrzutu i zniknąć w każdej chwili do następnego. Prawdziwy czas jest więc dłuższy — o najwyżej dwa odstępy między zrzutami, zwykle do 10 minut.
  • Odstęp bywa dłuższy niż 5 minut: przy przerwie w zbieraniu (stan zbierania danych) albo gdy portal przy każdym wejściu pokazuje trochę inny zestaw materiałów. Wtedy widzimy artykuł tylko w części zrzutów, a przerwy między obserwacjami bywają dłuższe niż jeden odstęp.

7Zniknięcia i ich próg#

„Zniknięcie” to artykuł, który był na stronie głównej krócej niż ćwierć zwykłego czasu. Co jest „zwykłym czasem”, liczymy osobno dla każdego portalu — jeden szybko wymienia materiały, inny trzyma je długo. Liczymy też osobno dla trzech pasm strony: górnych 10 % pozycji, pasma 10–30 % i pozostałych 70 %, bo artykuł na samym szczycie żyje inaczej niż ten na dole. „Zwykły czas” to mediana z ostatnich 7 dni, czyli wartość środkowa: połowa artykułów w tym paśmie była na stronie krócej, połowa dłużej.

Liczymy tylko przypadki widziane od początku do końca: co najmniej trzy zrzuty z artykułem, a przybycie i zejście widoczne między sąsiednimi zrzutami. Pasma, w których typowy artykuł wisi ponad dobę (stałe moduły strony), pomijamy — tam „zniknięcie” nic nie mierzy.

Przykład: jedno zniknięcie krok po kroku

Prawdziwy przypadek z 11.08.2026. Artykuł Faktu „Poruszający list do Marty Nawrockiej” nasze zrzuty złapały trzy razy:

  • 15:30:22 — pozycja 2 z 25 (najwyższa, czyli szczytowa)
  • 15:35:04 — pozycja 6 z 28
  • 15:40:08 — pozycja 7 z 28

Kolejny zrzut Faktu, o 15:45:13, już go nie zawierał. Dlatego liczymy to jako zniknięcie, a nie zwykłą przerwę w obserwacji: widzieliśmy zarówno zrzut, w którym artykuł się pojawił, jak i zrzut, w którym już go nie było.

Rachunek:

  1. Czas na stronie = ostatnia obserwacja minus pierwsza = 15:40:08 − 15:30:22 = 9 min 46 s, czyli 9,8 min (0,163 h). To dolna granica — prawdziwy czas mógł zacząć się do 5 minut wcześniej i skończyć do 5 minut później.
  2. Szczytowa pozycja to 2 z 25 — pasmo „górne 10 %”.
  3. Zwykły czas dla tego pasma na Fakcie z ostatnich 7 dni: mediana 95 min (1,58 h).
  4. 9,8 / 95 ≈ 10,3% normy.
  5. Próg to 25 %. 10,3 % jest wyraźnie poniżej, więc ten przypadek trafia na listę.

Próg 25 % ustaliliśmy sami

Granica nie wynika z żadnego wzoru. Sprawdziliśmy, jak zmienia się liczba zniknięć przy innych progach:

Liczba zniknięć w dniu, wszystkie obserwowane portale łącznie · zmierzone 11.08.2026

Próg 20.07.2026 01.08.2026 08.08.2026
10 %292025
20 %584246
25 % (używany na stronie)685350
33 %946260
50 %17395105

Większość dzisiejszej listy jest stabilna: 79–92 % tego, co liczymy jako zniknięcie, zostałoby zaliczone także przy ostrzejszym progu 20 %. Ale liczba wyraźnie rośnie przy łagodniejszych progach — powyżej 33 % niemal się podwaja. Kto porównuje liczby zniknięć między dniami albo portalami, powinien pamiętać, że są policzone przy jednym konkretnym progu.

8Wydarzenia i Historie#

Wydarzenie to grupa artykułów z różnych portali o tym samym zdarzeniu. Historia (piszemy wielką literą) to kilka wydarzeń, które składają się na jedną dłuższą sprawę — np. kolejne dni jednej afery. Który artykuł należy do którego wydarzenia, ocenia model językowy, czyli program AI tego rodzaju, co ChatGPT. To ocena, nie pomiar: może rozdzielić jedno wydarzenie na dwa albo połączyć dwa różne (opis metody: AfterglowBot).

Dlatego przy każdym wydarzeniu pokazujemy artykuły źródłowe z linkami — grupowanie można sprawdzić samodzielnie, zamiast ufać opisowi „4 portale opisały to wydarzenie”. Im wyższy poziom (wydarzenie → Historia), tym więcej oceny AI stoi za liczbą i tym ostrożniej warto ją traktować.

Jak bardzo model był pewny

Model podaje swoją pewność jako liczbę, np. 0,8732. Zamiast niej pokazujemy słowo: „wysokie”, „średnie” albo „niskie” — cztery cyfry po przecinku sugerowałyby dokładność, której model nie ma. Granice między słowami dobraliśmy, patrząc na 41 167 wydarzeń w naszej bazie (stan na 11.08.2026). Oceny modelu skupiają się przy górze skali — 67 % z nich to dokładnie 0,9. Gdybyśmy przyjęli okrągłą granicę, np. „0,7 i więcej = wysokie”, niemal każde wydarzenie miałoby pewność „wysoką” i słowo nic by nie znaczyło. Dlatego granice są takie:

Rozkład ocen modelu, 41 167 wydarzeń · stan na 11.08.2026

Słowo na stronie Ocena modelu Udział w bazie
wysokie≥ 0,983,1 %
średnie0,8–0,8915,0 %
niskie< 0,81,9 %

Wydarzenie bez oceny — model jej nie policzył albo próba oceny się nie udała, np. przez awarię — nie pokazuje żadnego słowa.

9Niepołączone wątki#

Dwa wątki tej samej sprawy bywają u nas niepołączone — np. „zaginięcie” i „znalezienie ciała” tej samej osoby jako dwa osobne wydarzenia bez wspólnej Historii. Mechanizm, który rozpoznaje, że oba dotyczą tej samej osoby lub instytucji, dopiero budujemy. Skutek: liczby „ile portali opisało” i listy „tylko jeden portal” mogą rozdzielić jedną sprawę na dwie. Gdzie to widzimy po podobnych tytułach, piszemy o tym wprost przy wierszu.

10Początek archiwum#

Archiwum zaczyna się 27.06.2026. Temat, który u nas zaczyna się tego dnia, mógł trwać wcześniej — nie widzieliśmy jego początku. Na osiach czasu zaznaczamy to rozmytym lewym końcem paska; w liczbach „kto pierwszy” dla takich tematów nie da się odpowiedzieć.

11Cztery napisy o braku#

Na stronach wydarzeń używamy czterech różnych napisów, bo za każdym stoi inny powód. Celowo ich nie mieszamy:

„Nie zaobserwowano u X”
W sprawdzanym przedziale czasu nie znaleźliśmy u X artykułu o tym wydarzeniu. Patrzyliśmy i nic nie znaleźliśmy — co nie dowodzi, że X o tym nie napisał (czego nie widzimy).
„Brak danych”
W tym czasie nie zbieraliśmy danych z tego portalu, więc nie wiemy, czy opisał to wydarzenie. To coś innego niż „nie zaobserwowano”: tam patrzyliśmy i nic nie znaleźliśmy, tutaj w ogóle nie patrzyliśmy.
„Opisane, bez pozycji (RSS)”
Wiemy, że artykuł istnieje — znaleźliśmy go w kanale RSS albo na liście linków — ale u tego portalu nie mierzymy pozycji na stronie głównej, bo jego strona układa się dopiero w przeglądarce. Brak pozycji nie znaczy brak artykułu.
„Obecność niepewna (rotacja)”
Niektóre portale przy każdym wejściu pokazują trochę inny zestaw materiałów — jakby miały kilka wersji strony głównej naraz. Wtedy ten sam artykuł widzimy w jednym zrzucie, a w następnym nie, choć na stronie cały czas był. Taką przerwę trudno odróżnić od prawdziwego zniknięcia. Próbujemy to rozróżnić na podstawie tego, jak dany portal zachowuje się zwykle. Gdy się nie da — piszemy, że nie wiemy.

12Warstwy — fakt, obliczenie, ocena#

Za każdą liczbą w serwisie stoi inna ilość naszej pracy. Niektóre to bezpośredni odczyt z zrzutu. Inne to obliczenie na takich odczytach. Jeszcze inne to ocena programu AI, który może się pomylić. Ostatni krok — wniosek — należy do czytelnika. Tabela mówi, do której grupy należy dana liczba:

Obserwacja — artykuł był na pozycji 7
bezpośredni odczyt z jednego zrzutu
Obserwacja — nagłówek miał wersję A, potem B
różnica między dwoma zrzutami
Obliczenie — zwykły czas na stronie w tym paśmie: 95 min
zwykła arytmetyka na obserwacjach — z tych samych danych zawsze wyjdzie ta sama liczba, bez udziału AI
Reguła — „zniknięcie” — krócej niż ćwierć zwykłego czasu
stała granica, którą ustaliliśmy sami i której skutki pokazujemy
Ocena AI — artykuły A, B i C to jedno wydarzenie
model językowy — może się pomylić, podaje, jak bardzo jest pewny
Wniosek — „portal eksponował ten temat”
to zdanie czytelnika, nie nasze

Im niżej w tabeli, tym więcej naszej — albo czytelnika — pracy stoi za liczbą. Dlatego przy każdym wydarzeniu i każdej cichej edycji pokazujemy dane źródłowe: można zatrzymać się na dowolnej warstwie i sprawdzić samodzielnie.