Co to jest LLM? Modele językowe — poradnik dla firm

Temat: Architektura systemów AI

Model językowy (LLM, large language model) to program, który nauczył się z ogromnej ilości tekstu przewidywać kolejne fragmenty wypowiedzi — i dzięki temu potrafi pisać, streszczać, tłumaczyć i analizować. Nie jest bazą wiedzy ani systemem firmy. Zna to, co było w danych treningowych do określonej daty, nie widzi Waszych dokumentów, dopóki ich nie dostanie, i potrafi się pomylić z pełnym przekonaniem. Dlatego w firmie wybiera się najpierw zadanie i sposób sprawdzenia wyniku, a dopiero potem model.

Poradnik jest dla zarządu i liderów IT w firmach od 50 osób, którzy słyszą „wdróżmy LLM” i chcą rozumieć, co kupują: czym różni się duży model od małego, otwarty od zamkniętego i gdzie model może działać. Na końcu jest mapa wszystkich wpisów o modelach na blogu. Szerszy kontekst — jak model łączy się z wiedzą, narzędziami i orkiestracją — daje filar architektura systemów AI.

Czym jest model językowy — prosto

Współczesne modele językowe stoją na architekturze Transformer, opisanej w pracy Attention Is All You Need (Vaswani i in., 2017). Mechanizm uwagi pozwala modelowi brać pod uwagę zależności między wszystkimi fragmentami tekstu naraz. Dla zarządu ważniejsze od architektury są trzy pojęcia: tokeny, trening i okno kontekstu.

Tokeny: w czym model liczy tekst

Model nie czyta liter ani całych słów. Tekst jest dzielony na tokeny: krótkie słowa, części dłuższych słów, znaki interpunkcyjne. W tokenach vendorzy podają limity i ceny. Anthropic w porównaniu modeli Claude podaje cenę za milion tokenów wejścia i wyjścia oraz zastrzega, że ta sama liczba tokenów mieści różną liczbę słów zależnie od tokenizera danego modelu. Wniosek praktyczny: koszt i limit długości zależą od modelu, więc porównujcie je na tym samym tekście.

Trening: wiedza do określonej daty

Model powstaje w dwóch etapach. Najpierw uczy się na ogromnym zbiorze tekstów przewidywać kolejne tokeny. Potem jest dostrajany, żeby wykonywał polecenia i odpowiadał w pożądany sposób, na przykład metodą RLHF opisaną w pracy Ouyang i in. (2022): ludzie oceniają odpowiedzi, a model uczy się preferowanych wariantów. Badacze ze Stanford nazwali takie modele, trenowane szeroko i dostosowywane do wielu zadań, modelami fundamentalnymi (Bommasani i in., 2021).

Skutek dla firmy: wiedza modelu kończy się na dacie treningu. Anthropic podaje dla każdego modelu osobno datę „wiarygodnej wiedzy” i datę danych treningowych — dla Claude Haiku 4.5 to odpowiednio luty i lipiec 2025 r. (stan na 6.10.2026). Wasz cennik z zeszłego tygodnia w treningu nie był. Wewnętrzna procedura też nie, bo nigdy nie była publiczna.

Okno kontekstu: pamięć robocza

Okno kontekstu to cały tekst, który model bierze pod uwagę przy jednej odpowiedzi: instrukcja, historia rozmowy, załączone dokumenty, wyniki narzędzi i sama odpowiedź. Anthropic w dokumentacji okna kontekstu nazywa je „pamięcią roboczą” modelu, w odróżnieniu od danych treningowych. Okna są duże — w obecnych modelach Claude od 200 tys. do 1 mln tokenów (stan na 6.10.2026) — ale ta sama dokumentacja zaznacza, że wraz z liczbą tokenów spada trafność i przywoływanie informacji. Więcej tekstu nie znaczy lepszej odpowiedzi. Znaczy wyższy rachunek.

Jak model językowy odpowiada na pytanie, w czterech krokach. Krok 1: tekst — pytanie, instrukcja i załączone dokumenty. Krok 2: tokeny — tekst dzielony na kawałki słów; limit to okno kontekstu. Krok 3: model przewiduje kolejne tokeny na podstawie wzorców z treningu; wiedza kończy się na dacie treningu. Krok 4: odpowiedź — płynna, ale nie zawsze prawdziwa. Co dokłada system wokół modelu: RAG wyszukuje dokumenty firmy i dołącza je do pytania w kroku 1; narzędzia pozwalają modelowi poprosić o dane z ERP lub CRM, a wywołanie wykonuje aplikacja; uprawnienia i testy ustalają, kto co widzi i co wolno zrobić bez człowieka.
Jak model odpowiada: tekst, tokeny, model i odpowiedź oraz to, co dokładają RAG, narzędzia i uprawnienia. Na podstawie dokumentacji Anthropic i OpenAI oraz pracy Vaswani i in. (2017).

Co model potrafi, a czego nie

Model świetnie radzi sobie z językiem: przekształca, streszcza, porządkuje, klasyfikuje i proponuje. Słabo radzi sobie z tym, co wymaga aktualnych faktów firmy, dokładnych obliczeń i odpowiedzialności za decyzję.

Model potrafiModel nie potrafi sam
streścić dokument, który dostałznać dokumentów, których nie dostał
wyciągnąć pola z maila lub fakturyzagwarantować, że pole jest poprawne
sklasyfikować zgłoszeniewiedzieć, kto w firmie może co zobaczyć
napisać szkic odpowiedzisprawdzić, czy rabat w szkicu jest dozwolony
zaproponować plan analizywziąć odpowiedzialności za decyzję

Halucynacje. NIST w profilu ryzyka generatywnej AI (NIST AI 600-1) używa słowa „konfabulacja” dla pewnie podanej treści, która jest fałszywa. Wynika ona z samej konstrukcji modelu, który przewiduje prawdopodobny ciąg dalszy. Badacze OpenAI w pracy Why Language Models Hallucinate (2025) dodają, że trening i testy częściej nagradzają zgadywanie niż przyznanie się do niepewności. Model zapytany o nieistniejący paragraf regulaminu chętnie go zacytuje. Z numerem strony.

Brak dostępu do danych firmy. Model nie widzi Waszego ERP, CRM ani dysku, dopóki aplikacja mu czegoś nie poda. Są cztery drogi, żeby korzystał z wiedzy firmy: prompt z dokumentem, RAG, fine-tuning i RAFT. Opisuje je poradnik o RAG i danych firmy w AI. Krótko: brakuje wiedzy — RAG; model działa niespójnie — dopiero wtedy trening.

Szczegółowy przegląd zadań, w których LLM wnosi wartość, i testów przed wdrożeniem jest we wpisie Duże modele językowe: możliwości i ograniczenia.

LLM i SLM: duży czy mały model

Nie ma jednej granicy między dużym a małym modelem. IBM opisuje małe modele językowe (SLM) jako mające od kilku milionów do kilku miliardów parametrów, ale to jedno źródło, nie norma. Microsoft nazywa swoją rodzinę Phi małymi modelami i podkreśla, że mogą działać w chmurze, na brzegu sieci i bezpośrednio na urządzeniu, bez połączenia z chmurą.

Duży model (LLM)Mały model (SLM)
Typowe zadaniazłożona analiza, długie dokumenty, pisanie, kodwąskie i powtarzalne: klasyfikacja, ekstrakcja, routing
Gdzie działazwykle API vendora lub chmuratakże laptop, serwer w firmie, urządzenie
Koszt jednego wywołaniawyższyniższy
Ryzykokoszt i czas przy prostych zadaniachsłabsza jakość przy zadaniach spoza wąskiego zakresu

Coraz częściej firmy łączą oba rodzaje: mały model obsługuje większość prostych przypadków, a trudniejsze przekazuje dużemu. Anthropic opisuje taki wzorzec w poradniku wyboru modelu: tańszy model wykonuje pracę, a droższy rozstrzyga trudne decyzje. Więcej o małych modelach: Małe modele językowe SLM: kiedy mają sens w firmie.

Modele otwarte i zamknięte

Model zamknięty udostępnia vendor przez swoją aplikację, API albo chmurę partnera — tak działają na przykład modele Claude, GPT czy Gemini. Wag modelu nie dostajecie. Płacicie za użycie, a warunki określa umowa.

Model z otwartymi wagami można pobrać i uruchomić na własnym sprzęcie. Daje to kontrolę nad tym, gdzie trafiają dane, ale przenosi na firmę utrzymanie, bezpieczeństwo i aktualizacje. „Otwarte wagi” to jeszcze nie open source. Open Source AI Definition 1.0 organizacji OSI wymaga swobody użycia, badania, zmiany i udostępniania oraz dostępu do kodu, informacji o danych treningowych i parametrów.

Licencje modeli otwartych bardzo się różnią. Przykłady, stan na 6.10.2026:

  • Gemma 4 od Google ma licencję Apache 2.0.
  • Llama 4 od Meta ma własną licencję społecznościową: firmy z ponad 700 mln aktywnych użytkowników miesięcznie muszą prosić Meta o osobną licencję, a produkt ma oznaczenie „Built with Llama”.
  • Mistral część modeli udostępnia na Apache 2.0, a część jako modele komercyjne na innych warunkach.

Licencję czyta się dla konkretnego modelu i wersji, nie dla całej rodziny. Ocenę licencji i otwartych narzędzi zbiera filar Open Source AI, a co oznacza sama licencja Apache 2.0, wyjaśnia wpis Apache 2.0: licencja open source dla firmowego AI. Umowę i licencję ocenia prawnik — ten poradnik pokazuje, o co zapytać.

Rozumowanie i multimodalność

Modele z rozumowaniem przed odpowiedzią wykonują dodatkowy etap „myślenia”: rozkładają zadanie na części i rozważają kilka podejść. OpenAI w przewodniku o modelach rozumujących wyjaśnia, że te dodatkowe tokeny zajmują okno kontekstu i są rozliczane jak tokeny wyjścia, a parametr wysiłku pozwala wybrać między szybkością a dokładnością. Anthropic w modelach Claude stosuje podobny mechanizm, w którym model sam dobiera ilość myślenia. Rozumowanie pomaga przy planowaniu, kodzie i analizie wieloetapowej. Przy streszczeniu maila to zwykle przepłacanie. Historię pierwszego takiego modelu opisuje wpis OpenAI o1 w Azure: rozumowanie i migracja modelu.

Modele multimodalne przyjmują nie tylko tekst. Wszystkie obecne modele Claude przyjmują tekst i obrazy, a modele Gemini także wideo i dźwięk (stan na 6.10.2026). W firmie oznacza to czytanie skanów, zdjęć z hali, wykresów i nagrań. Zasada jest ta sama co przy tekście: model może źle odczytać liczbę z rozmazanego zdjęcia faktury, więc wynik trafia do walidacji, a nie prosto do księgowości.

Gdzie uruchomić model

Ten sam model bywa dostępny w kilku miejscach. Wybór zależy od danych, regionu i tego, kto ma utrzymywać infrastrukturę.

MiejsceJak to działaDla kogo
API vendoraaplikacja wysyła zapytanie do OpenAI, Anthropic, Googleszybki start, mały zespół
Chmuramodel w Microsoft Foundry, Amazon Bedrock albo Google Vertex AI, w ramach umowy z chmurąfirmy, które już mają chmurę i jej zasady bezpieczeństwa
Własny serwermodel z otwartymi wagami na własnych GPU, na przykład z vLLM albo NVIDIA NIMdane nie mogą opuścić firmy, jest zespół do utrzymania

Dwa pytania o dane trzeba zadać przy każdym wariancie. Pierwsze: czy vendor używa zapytań do trenowania? Microsoft w opisie przetwarzania danych w Foundry podaje, że prompty i odpowiedzi nie są dostępne dla OpenAI ani innych vendorów modeli i nie służą do trenowania modeli bazowych. Drugie: gdzie dane są przetwarzane? W tej samej dokumentacji wdrożenie typu „Global” może przetwarzać zapytania w dowolnym regionie, a „Data Zone” w Unii Europejskiej — tylko w państwach UE. Sposób wdrożenia modeli w Foundry opisuje wpis MaaS w Microsoft Foundry: wybór wdrożenia.

Jak wybrać model: pięć kryteriów

Vendorzy mówią tu zaskakująco zgodnie. Anthropic w poradniku wyboru modelu wskazuje zestaw testów na własnych danych jako najważniejszy krok. OpenAI w przewodniku wyboru modelu radzi zostać przy najlżejszym ustawieniu, które spełnia próg jakości. Na tej podstawie proponuję pięć kryteriów, w tej kolejności:

  1. Zadanie. Jedno, konkretne: „wyciągnij pięć pól z reklamacji”, a nie „AI dla działu obsługi”. Bez zadania nie ma czego porównywać.
  2. Jakość na Waszych testach. Zestaw prawdziwych przykładów z oczekiwanym wynikiem, w tym przypadki trudne i bez odpowiedzi. Publiczny ranking mierzy cudze zadania.
  3. Koszt jednego poprawnego zadania. Cena tokenów plus wyszukiwanie, integracja, nadzór i poprawki człowieka. Tańszy model, który dwa razy częściej trafia do poprawki, nie jest tańszy.
  4. Dane. Jakie dane trafią do modelu, czy vendor może ich użyć i jak długo je przechowuje. To decyduje, czy wystarczy API, czy potrzebny jest własny serwer.
  5. Region i umowa. Gdzie dane są przetwarzane, kto odpowiada za incydent i co się stanie, gdy vendor wycofa wersję modelu.

Ramę zarządzania ryzykiem daje NIST AI RMF 1.0 — dobrowolny standard z czterema funkcjami: Govern, Map, Measure i Manage. Dla zarządu to prosta lista kontrolna: kto odpowiada, gdzie model działa, jak mierzymy wynik, co robimy po błędzie.

Karta: jaki model do jakiego zadania. Szkic, analiza i długie dokumenty: duży model (LLM) przez API lub chmurę; uwaga na koszt i czas. Wąskie, masowe zadanie, na przykład klasyfikacja lub ekstrakcja: mały model (SLM); uwaga, test na własnych danych. Dane nie mogą opuścić firmy: model z otwartymi wagami na własnym serwerze; uwaga na licencję i utrzymanie. Szybki start bez zespołu infrastruktury: model zamknięty vendora przez API lub chmurę; uwaga na region i umowę. Plan, kod, analiza wieloetapowa: model z rozumowaniem; dłużej i drożej. Skany, zdjęcia, nagrania: model multimodalny; test na własnych plikach. Zawsze: wybór rozstrzyga test na Waszych przykładach, nie ranking. Uproszczenie autora.
Jaki model do jakiego zadania: LLM, SLM, model otwarty, zamknięty, z rozumowaniem i multimodalny. Uproszczenie autora na podstawie zaleceń Anthropic i OpenAI; szczegóły w tabeli i kryteriach powyżej.

Jeśli dziś w firmie nikt nie potrafi wskazać jednego zadania i osoby, która oceni wynik modelu, porównywanie modeli jest przedwczesne. Najpierw warto nazwać proces, dane i kryterium „dobrze” — po to jest prezentacja dla zarządu, niezależnie od vendora i partnera.

Od asystenta do agenta

Sam model tylko odpowiada tekstem. Żeby coś zrobił — sprawdził stan magazynu, założył zgłoszenie, policzył marżę — aplikacja daje mu narzędzia. Anthropic w dokumentacji narzędzi opisuje to tak: model decyduje, kiedy wywołać narzędzie, i zwraca ustrukturyzowane wywołanie, a wykonuje je aplikacja. To ważne dla bezpieczeństwa: uprawnienia nadaje system, nie model.

Gdy model sam planuje kolejne kroki i wywołuje narzędzia aż do celu, mówimy o agencie AI. Czym agent różni się od asystenta i chatbota i kto zatwierdza jego działania, opisuje poradnik o agentach AI. Konkretne produkty, w których modele działają jako asystenci, opisują poradnik o ChatGPT i poradnik o Claude. Ryzyka aplikacji z modelami zbiera OWASP LLM Top 10 2026.

Mapa wpisów o modelach językowych

Wszystkie wpisy o modelach na blogu, w sześciu grupach. Zacznijcie od grupy, która odpowiada Waszemu pytaniu.

A. Podstawy: czym są modele

B. Jak model się uczy i dostosowuje

C. Rozumowanie, multimodalność i inne kategorie modeli

D. Gdzie uruchomić model

E. Modele z otwartymi wagami

F. Modele vendorów

Modele zamknięte opisują osobne poradniki: ChatGPT i modele OpenAI oraz Claude i modele Anthropic. Wpisy o pojedynczych modelach:

Najważniejsze w skrócie

  • Model językowy przewiduje kolejne tokeny. Pisze płynnie, ale nie odczytuje faktów z bazy i może się mylić z pełnym przekonaniem.
  • Wiedza modelu kończy się na dacie treningu, a danych firmy model nie zna, dopóki ich nie dostanie — przez RAG albo narzędzia.
  • Okno kontekstu to pamięć robocza. Większe okno nie oznacza lepszej odpowiedzi, tylko wyższy koszt.
  • Mały model wystarczy do wąskich, masowych zadań; duży do złożonej analizy. Często najlepiej działają oba razem.
  • Otwarte wagi to nie zawsze open source. Licencję czyta się dla konkretnego modelu i wersji.
  • Model wybiera się po zadaniu, testach na własnych przykładach, koszcie poprawnego zadania, danych i regionie — w tej kolejności.
Portret Krzysztofa Majchrzyckiego

O autorze

Krzysztof Majchrzycki jest architektem systemów i AI Business Partnerem. Od wielu lat łączy technologię z biznesem i zarządzaniem. Współtworzył firmy technologiczne i kierował polskim oddziałem międzynarodowej grupy. Dziś projektuje modele firm i inteligentne systemy operacyjne, które z nich wynikają. Ukończył Executive MBA i ma certyfikat Prosci® Certified Change Practitioner.

Wybierzmy zadanie, zanim wybierzecie model

Prezentacja dla zarządu: nazwiemy jeden proces, dane, z których model ma korzystać, i sposób sprawdzenia wyniku. Dopiero potem porównanie modeli i miejsca ich uruchomienia. Niezależnie od vendora i partnera.

FAQ

Najczęstsze pytania

Czym różni się LLM od ChatGPT albo Claude?

LLM to rodzaj programu: model, który przewiduje kolejne fragmenty tekstu. ChatGPT i Claude to produkty zbudowane na takich modelach — z oknem rozmowy, pamięcią, narzędziami, ustawieniami bezpieczeństwa i umową. Ten sam model może działać w czacie, w aplikacji firmy przez API albo w chmurze Microsoft, AWS czy Google.

Czy model językowy uczy się na naszych rozmowach?

Sam model w trakcie rozmowy się nie zmienia. Pytanie brzmi, czy vendor może później użyć Waszych danych do trenowania. To zależy od produktu i umowy. Microsoft dla modeli w Foundry podaje, że prompty i odpowiedzi nie służą do trenowania modeli bazowych. Dla każdego narzędzia sprawdźcie to w warunkach wersji firmowej.

Dlaczego model podaje nieprawdziwe informacje?

Bo generuje tekst pasujący do wzorców, a nie odczytuje faktów z bazy. NIST nazywa to konfabulacją: pewnie podaną, błędną treścią. Ryzyko zmniejszają źródła dołączone do pytania (RAG), polecenie mówienia „nie wiem” i testy, ale żadne ustawienie nie usuwa go całkiem.

Czy mały model (SLM) wystarczy w firmie?

Do wąskiego, powtarzalnego zadania — często tak: klasyfikacja zgłoszeń, wyciąganie pól z dokumentów, praca na urządzeniu bez chmury. Do złożonej analizy i długich dokumentów zwykle potrzebny jest większy model. Rozstrzyga test na Waszych przykładach, nie liczba parametrów.

Czy model otwarty to to samo co open source?

Nie zawsze. „Otwarte wagi” oznaczają, że można pobrać i uruchomić model. Open Source AI Definition 1.0 organizacji OSI wymaga więcej: kodu, informacji o danych treningowych i parametrów na otwartych warunkach. Licencje modeli bywają też różne — Gemma 4 ma Apache 2.0, a Llama 4 własną licencję społecznościową Meta z ograniczeniami.

Ile kosztuje korzystanie z modelu językowego?

W API płaci się zwykle za tokeny wejścia i wyjścia, a modele z rozumowaniem zużywają dodatkowe tokeny na „myślenie”. Ale cena tokenu to mała część kosztu. Liczcie koszt jednego poprawnie wykonanego zadania: z wyszukiwaniem, integracją, testami, nadzorem i poprawkami człowieka.

Który model jest najlepszy dla firmy?

Nie ma jednego. Rankingi zmieniają się co kilka tygodni i mierzą zadania, których Wasza firma nie wykonuje. Najlepszy jest najprostszy i najtańszy model, który przechodzi Wasz zestaw testowy, w regionie i na warunkach zgodnych z Waszymi zasadami danych.