Przejdź do treści
Wróć do bloga
4 min czytania

Modele fundamentalne uczą się liczb, nie tylko słów

Model fundamentalny uczy się raz, na ogromnej ilości danych, a potem obsługuje wiele różnych zadań bez trenowania od nowa. Tak działa ChatGPT na tekście. Od kilkunastu miesięcy ta sama recepta trafia na liczby: tabele, transakcje i szeregi czasowe, czyli dokładnie to, co Twoja firma zbiera w systemach od lat.

Modele fundamentalneDane tabelaryczneFintech

Przez ostatnią dekadę uczenie maszynowe w firmach wyglądało zawsze tak samo. Do każdego pytania budowało się osobny model: jeden do prognozy sprzedaży, drugi do oceny ryzyka, trzeci do rekomendacji. Każdy miał własne dane, własne przygotowanie cech i własne utrzymanie. Najwięcej czasu zajmowało nie samo uczenie, tylko żmudne układanie danych pod jedno konkretne pytanie.

Jeden model zamiast dziesięciu

Model fundamentalny odwraca tę kolejność. Najpierw powstaje jeden duży model, uczony na ogromnym zbiorze danych bez konkretnego zadania, a dopiero potem przykłada się go do kolejnych pytań. Z tekstem znamy to z ChatGPT. Nowość ostatnich kilkunastu miesięcy polega na tym, że ta sama recepta zaczęła działać na danych liczbowych, i to lepiej niż metody, które w tabelach rządziły od lat.

TabPFN: przewidywanie bez uczenia modelu

TabPFN pracuje na zwykłych tabelach: wiersze, kolumny i jedna kolumna do przewidzenia. Opisano go w „Nature” w styczniu 2025 roku, a rozwija go Prior Labs, firma założona przez autorów tej pracy. Najdziwniejsze jest to, że model w ogóle nie uczy się na Twoich danych. Został wytrenowany wcześniej, na około 130 milionach sztucznie wygenerowanych zbiorów. Twoją tabelę dostaje na wejściu i zwraca przewidywania w jednym przebiegu, bez strojenia.

  • Wersja opisana w „Nature” obsługuje zbiory do 10 000 wierszy i 500 kolumn.
  • Według abstraktu tej pracy wypada lepiej niż drzewa wzmacniane gradientowo strojone przez cztery godziny, przy przyspieszeniu rzędu 5140 razy dla klasyfikacji.
  • TabPFN 2.5 podniósł limit do 50 000 wierszy i 2000 kolumn i dorównuje dokładnością AutoGluonowi strojonemu przez cztery godziny.
  • TabPFN 3 z maja 2026 przyjmuje już milion wierszy i 200 kolumn.
Wykres słupkowy: TabPFN v2 przyjmuje 10 tysięcy wierszy, TabPFN 2.5 pięćdziesiąt tysięcy, a TabPFN 3 milion.
Limit wielkości tabeli rósł w kolejnych wersjach o dwa rzędy wielkości w półtora roku.Źródło: dane: Prior Labs i Nature 2025Otwórz w pełnym rozmiarze
Siatka wykresów: górny rząd pokazuje prawdziwy wzorzec w danych, kolejne rzędy to dopasowania TabPFN, CatBoost, sieci MLP i regresji liniowej.
Ten sam wzorzec widziany przez cztery metody. Wiersz TabPFN trzyma się kształtu danych tam, gdzie pozostałe rysują schodki albo prostą.Źródło: rys. 3 z pracy Hollmann i in., Nature 637 (2025), CC BY 4.0Otwórz w pełnym rozmiarze

PRAGMA: 24 miliardy zdarzeń z jednego banku

Revolut poszedł w drugą stronę i wziął własną historię. PRAGMA to rodzina modeli od 10 milionów do miliarda parametrów, wytrenowana na 24 miliardach zdarzeń bankowych od 26 milionów użytkowników ze 111 krajów, co dało 207 miliardów tokenów z 25 miesięcy. Zdarzeniem jest tu nie tylko przelew, ale też wejście do aplikacji czy zmiana ustawień konta. Jeden wspólny model obsługuje zadania, które wcześniej wymagały osobnych systemów: scoring, fraud, rekomendacje i kilka innych.

Wykres słupkowy siedmiu zadań. Scoring kredytowy poprawił się o 130,2 procent, wykrywanie fraudu o 64,7 procent, a przeciwdziałanie praniu pieniędzy wypadło o 47,1 procent gorzej.
Wszystkie wyniki podane w pracy, razem z tym jednym, który wyszedł gorzej.Źródło: dane: praca PRAGMA, arXiv 2604.08649Otwórz w pełnym rozmiarze

Wyniki są nierówne i właśnie dlatego warto na nie patrzeć. Scoring kredytowy poprawił się o 130,2 procent w mierze PR‑AUC. Wykrywanie fraudu łapie o 64,7 procent więcej przypadków, i to przy wyższej precyzji. Rekomendacje produktów zyskały 40,5 procent. Przy przewidywaniu wartości klienta różnica jest w granicach błędu, a przeciwdziałanie praniu pieniędzy wypadło o 47,1 procent gorzej niż dotychczasowe rozwiązanie.

W opisie wdrożenia pada też rzecz, która w praktyce znaczy więcej niż pojedyncza metryka: przygotowanie cech, czyli najdroższy etap klasycznego projektu, skróciło się z miesięcy niemal do zera, bo model dostaje surową historię zdarzeń zamiast ręcznie policzonych wskaźników. Najmniejszy model z tej rodziny wytrenowano w około dwa dni na szesnastu kartach.

Synthefy: modele dla szeregów czasowych

Trzeci przykład jest znacznie wcześniejszy na osi czasu. Synthefy zebrało w sierpniu 2026 roku 6,5 miliona dolarów na modele fundamentalne dla danych ustrukturyzowanych: tabel, sygnałów i szeregów czasowych. Firma zapowiada między innymi generowanie syntetycznych szeregów czasowych z opisu tekstowego, żeby dało się testować rozwiązania bez ruszania prawdziwych danych klientów. To na razie zapowiedź i pieniądze, a nie recenzowane wyniki, więc traktuj to jako sygnał kierunku, a nie gotowe narzędzie.

Co to znaczy dla firmy bez zespołu AI

  • Twoje dane już mają właściwy kształt. Tabela z zamówieniami albo historia transakcji to dokładnie ten materiał, na którym te modele pracują.
  • Mały zbiór przestał być przeszkodą. W tabelach do kilkudziesięciu tysięcy wierszy nowe modele wygrywają z metodami, które wymagały tygodni strojenia.
  • Najdroższy etap tanieje. Skoro model przyjmuje surową historię, mniej czasu idzie na ręczne przygotowanie cech.
  • Porządek w danych nadal decyduje. Żaden model fundamentalny nie naprawi niespójnych identyfikatorów ani brakujących dat.

Czego te wyniki nie obiecują

Wynik z pracy naukowej to wynik na danych jej autorów. Revolut miał 24 miliardy zdarzeń, Ty prawdopodobnie nie masz, a i tak jedno z siedmiu zadań wyszło u nich gorzej. TabPFN świetnie radzi sobie z małą tabelą i nie zastąpi systemu rekomendacji działającego na milionach zdarzeń. Jedyny wiarygodny test to Twoje dane i miara sukcesu ustalona, zanim cokolwiek uruchomimy.

Jeśli chcesz sprawdzić, czy któreś z tych podejść ma sens przy Twoim procesie, napisz do nas. Zwykle wystarczy jedna tabela i jedno pytanie, na które ma odpowiadać.

Źródła

  1. 01Hollmann et al., Accurate predictions on small data with a tabular foundation model, Nature 637 (2025)
  2. 02Prior Labs, TabPFN‑2.5 model report
  3. 03Prior Labs, TabPFN‑3 technical report
  4. 04Ostroukhov et al., PRAGMA: Revolut Foundation Model, arXiv 2604.08649
  5. 05NVIDIA, Revolut case study
  6. 06Synthefy, seed round announcement, August 2026

Więcej z bloga

5 min czytania

Jev: model, który zwraca decyzję zamiast zdania

TypeSafe AI wypuściło 15 września model, który nie pisze tekstu. Oddaje wybraną opcję i prawdopodobieństwo, kosztuje 0,042 dolara za milion tokenów wejściowych, a za wyjście nie płaci się nic. Sprawdzamy, co z tego zostaje po odjęciu marketingu.

Czytaj
6 min czytania

Umiejętności agenta: dlaczego pięć działa lepiej niż sto

Przy puli pięciu skilli właściwy stanowi 29,6% tych, po które agent faktycznie sięga, przy stu już tylko 3,3%. W sierpniu publiczny rejestr skilli rozdawał klony, które kradły klucze SSH. Cztery zasady dla zespołu, który pracuje z agentami.

Czytaj

Opisz proces, który zabiera najwięcej czasu

Wystarczy kilka zdań. Odpowiemy, czy da się go usprawnić, ile to mniej więcej kosztuje i czy w ogóle potrzebujesz do tego AI.