Moduł 1 · Czym jest ChatGPT i jak zacząć
Jak działa ChatGPT: tokeny, przewidywanie i Transformer
Po tej lekcji wyjaśnisz własnymi słowami, jak ChatGPT tworzy odpowiedź: czym są tokeny, co znaczy „przewidywanie kolejnego tokenu” i skąd biorą się błędy, które trzeba sprawdzać.
Tekst zamieniony na tokeny
ChatGPT to aplikacja zbudowana na dużym modelu językowym (ang. large language model, LLM). Model nie czyta tekstu tak jak człowiek, słowo po słowie. Najpierw dzieli go na tokeny. Token może być całym słowem, kawałkiem słowa, pojedynczym znakiem albo znakiem interpunkcyjnym. Nawet spacja przed słowem zmienia podział: „Red” i „ red” to dla modelu różne ciągi.
Pomoc OpenAI podaje orientacyjną miarę dla tekstu angielskiego: 1 token to około 4 znaki, a 100 tokenów to około 75 słów. Ta sama dokumentacja zastrzega, że w innych językach proporcje są inne. Polski ma długie słowa i dużo odmian, więc nie przeliczaj stron na tokeny „na oko” według angielskiej reguły.
Po co Ci ta wiedza w codziennej pracy? Z dwóch powodów:
- Limit rozmowy. Każda rozmowa ma okno kontekstu, czyli maksymalną liczbę tokenów, z którą model pracuje naraz. Cennik ChatGPT podaje je w tysiącach tokenów, np. 27K w planie Free i 54K w planach Go i Plus dla szybkich odpowiedzi (stan na 2.10.2026). Bardzo długi wątek albo duży dokument może się „nie zmieścić” i model zacznie gubić wcześniejsze ustalenia.
- Koszt w API. W API płaci się za tokeny wejściowe i wyjściowe. Wrócimy do tego w module 8.
Przewidywanie kolejnego tokenu
Model językowy generuje odpowiedź po kawałku. Na podstawie całego dotychczasowego tekstu — Twojego pytania, wcześniejszych wiadomości i instrukcji — wylicza, jaki token najlepiej pasuje jako następny. Dopisuje go i powtarza ten krok, aż odpowiedź będzie gotowa.
Uproszczony schemat. Źródła: Vaswani i in. (2017), pomoc OpenAI o tokenach.
Z tego mechanizmu wynikają dwie praktyczne zasady:
- Kontekst rządzi odpowiedzią. Model nie zgaduje, czego chcesz, tylko „ciągnie dalej” to, co dostał. Im precyzyjniej opiszesz zadanie, tym węższy zbiór sensownych kontynuacji.
- Płynny tekst nie oznacza prawdy. Model wybiera kontynuację, która dobrze pasuje do wzorców z treningu. Może więc napisać przekonujące, ale fałszywe zdanie — podać nieistniejący przepis, wymyślony cytat albo złą datę. Badacze OpenAI w pracy „Why language models hallucinate” (wrzesień 2025) wyjaśniają, że typowe metody treningu i oceny nagradzają zgadywanie bardziej niż przyznanie się do niepewności.
Nowsze modele „rozumujące” dodatkowo wykonują wewnętrzne rozumowanie, zanim napiszą odpowiedź. Tokeny tego rozumowania nie są pokazywane jako tekst, ale wliczają się do zużycia. O trybach myślenia w ChatGPT opowiemy w module 3.
Transformer i mechanizm uwagi
Podstawą współczesnych modeli GPT jest architektura Transformer, opisana w 2017 roku przez zespół Google w pracy „Attention Is All You Need”. Jej kluczowy element to mechanizm uwagi (ang. self-attention). Pozwala on modelowi przy każdym kroku „spojrzeć” na wszystkie wcześniejsze tokeny naraz i ocenić, które są ważne.
Przykład: w zdaniu „Firma z Poznania wysłała fakturę do klienta, ale on jej nie opłacił” słowo „on” odnosi się do klienta, a „jej” do faktury. Mechanizm uwagi pomaga modelowi powiązać takie odwołania nawet wtedy, gdy dzieli je kilka zdań. Starsze sieci przetwarzały tekst ściśle po kolei i gorzej radziły sobie z długimi zależnościami.
Nie musisz znać matematyki Transformera, żeby dobrze pracować z ChatGPT. Wystarczy model myślowy: „asystent, który bardzo dobrze kontynuuje tekst na podstawie wszystkiego, co mu dałem, i niczego więcej nie wie na pewno”.
Co z tego wynika w praktyce
Pani Ewa prowadzi biuro rachunkowe w Lublinie i chce wysłać klientom przypomnienie o terminie przesłania dokumentów. Prompt „napisz przypomnienie” da poprawny, ale nijaki tekst. Prompt z kontekstem — kto pisze, do kogo, jaki termin, jaki ton, jaka długość — daje tekst gotowy prawie bez poprawek. Jeśli jednak poprosi ChatGPT o „aktualne terminy podatkowe”, musi je sprawdzić w źródle, np. na podatki.gov.pl. Model mógł je źle zapamiętać, a przepisy się zmieniają.
Zapamiętaj trzy nawyki:
- podawaj kontekst, którego model nie zna: firmę, odbiorcę, cel, ograniczenia;
- dziel duże zadania na etapy i nie wklejaj wszystkiego naraz;
- każdą liczbę, datę, przepis i cytat weryfikuj w źródle, zanim ich użyjesz.
Najważniejsze w 3 punktach
- ChatGPT dzieli tekst na tokeny i tworzy odpowiedź, wybierając kolejne tokeny na podstawie całego kontekstu rozmowy.
- Architektura Transformer z mechanizmem uwagi pozwala modelowi wiązać odległe fragmenty tekstu, ale nie daje mu gwarancji prawdziwości.
- Dobry wynik zależy od kontekstu w prompcie, a liczby, daty i przepisy zawsze sprawdzasz w źródle.
Źródła
- Vaswani A. i in., „Attention Is All You Need”, 2017 — arxiv.org/abs/1706.03762
- OpenAI Help Center, „Understanding and counting tokens”, stan na 2.10.2026 — help.openai.com/en/articles/4936856
- OpenAI, „Why language models hallucinate”, wrzesień 2025 — openai.com/index/why-language-models-hallucinate
- OpenAI, cennik ChatGPT (okna kontekstu w planach), stan na 2.10.2026 — chatgpt.com/pl-PL/pricing