Podstawy
To wersja referencyjna: 55 pojęć, najpierw definicja, potem szczegół. Jeśli chcesz łagodniejszej wersji, obejmującej tylko słowa ważne w pierwszym tygodniu, przeczytaj zamiast tego Pojęcia AI wyjaśnione i wróć tutaj, gdy jakieś pojęcie cię tu skieruje.
Sztuczna inteligencja
Sztuczna inteligencja to oprogramowanie wykonujące zadania, które normalnie wymagają ludzkiego osądu, takie jak pisanie, rozumowanie czy rozpoznawanie tego, co jest na obrazku.
W codziennym użyciu w 2026 roku "AI" niemal zawsze oznacza asystentów czatu zbudowanych na dużych modelach językowych, a nie szerszą dziedzinę akademicką.
Uczenie maszynowe
Uczenie maszynowe to technika uczenia oprogramowania poprzez pokazywanie mu przykładów, zamiast programowania go regułami.
Każdy nowoczesny asystent AI jest zbudowany w ten sposób: zachowanie wynika ze wzorców w danych treningowych, dlatego ten sam model potrafi być znakomity w zadaniach typowych, a niepewny w rzadkich.
Model
Model to jeden konkretny wytrenowany system AI, artefakt, do którego faktycznie wysyłasz prompt.
GPT, Claude i Gemini to rodziny modeli; rodzina zawiera pojedyncze modele o różnych rozmiarach, szybkościach i cenach. Wybieranie między nimi w zależności od zadania to podstawowa umiejętność dobrego korzystania z AI.
LLM (duży model językowy)
LLM, czyli duży model językowy, to model wytrenowany na ogromnych ilościach tekstu, by przewidywać, jaki tekst powinien nastąpić dalej.
Właśnie ta jedna sztuczka, wykonywana na wielką skalę, produkuje odpowiedzi, szkice, kod i streszczenia. "Duży" odnosi się zarówno do danych treningowych, jak i liczby parametrów.
Chatbot
Chatbot to interfejs konwersacyjny otaczający model, rzecz z okienkiem wiadomości.
To rozróżnienie ma znaczenie przy porównywaniu produktów: dwa chatboty mogą otaczać ten sam model i sprawiać wrażenie różnych, a jeden chatbot może oferować wiele modeli, co jest właśnie sposobem działania Whizi.
Prompt
Prompt to wszystko, co wysyłasz do modelu: pytanie, instrukcje i każdy dołączony tekst czy plik.
Jakość odpowiedzi ściśle podąża za jakością promptu. Kontekst, ograniczenia i format wyniku, jaki chcesz otrzymać, to trzy rzeczy, które początkujący najczęściej pomijają.
Token
Token to mały fragment tekstu, który model faktycznie czyta i pisze, średnio mniej więcej trzy czwarte angielskiego słowa.
Ceny, szybkość i okna kontekstowe są mierzone w tokenach, dlatego to słowo pojawia się na każdej stronie z cennikiem AI. Dokument liczący 1000 słów to mniej więcej 1300 tokenów.
Okno kontekstowe
Okno kontekstowe to maksymalna ilość tekstu, mierzona w tokenach, którą model może naraz wziąć pod uwagę.
Dzielą je twój prompt, dotychczasowa rozmowa, załączone dokumenty i odpowiedź. Tabela porównania okien kontekstowych podaje aktualną wartość dla każdego głównego modelu, a wyjaśnienie tłumaczy, dlaczego to ono odpowiada za większość skarg typu "AI zapomniało".
Parametry
Parametry to wewnętrzne liczby, których model nauczył się podczas treningu, i zwykła miara jego rozmiaru.
Liczone w miliardach, więcej parametrów luźno oznacza więcej możliwości i więcej kosztu. To słaba miara sama w sobie przy wyborze; benchmarki i twoje własne testy biją liczbę parametrów.
Odpowiedź
Odpowiedź to wynik działania modelu dla jednego promptu, nazywana też completion.
Odpowiedzi są generowane od nowa za każdym razem, dlatego ponowne wygenerowanie tego samego promptu daje inne sformułowanie, a czasem inną odpowiedź.
Rozmowa z modelem
Prompt systemowy
Prompt systemowy to stała instrukcja, którą model otrzymuje przed twoją wiadomością, ustalająca jego rolę, ton i zasady.
Każdy produkt go ma, nawet gdy go nie widzisz. Gdy chatbot "ma osobowość", to zwykle właśnie tam ona mieszka.
Inżynieria promptów
Inżynieria promptów to celowe pisanie promptów, żeby uzyskać wiarygodnie lepszy wynik.
Mimo górnolotnej nazwy, w większości chodzi o zwykłą klarowność: określ cel, podaj kontekst, pokaż przykład, nazwij format. Przewodnik dla początkujących omawia techniki, które faktycznie przesuwają wyniki.
Zero-shot
Zero-shot oznacza proszenie modelu o wykonanie zadania bez podawania mu żadnych przykładów.
Współczesne modele radzą sobie z większością codziennych zadań w trybie zero-shot. Termin przetrwał głównie jako przeciwieństwo promptowania few-shot.
Few-shot
Few-shot oznacza dołączenie do promptu garści gotowych przykładów, żeby model skopiował wzorzec.
To najtańszy sposób na poprawę niezawodności przy pracy wrażliwej na formatowanie: dwa lub trzy przykłady wejścia i pożądanego wyjścia biją akapit opisu.
Chain of thought (łańcuch myślenia)
Chain of thought to model przechodzący przez kroki pośrednie, zanim poda ostateczną odpowiedź.
Proszenie modelu o rozumowanie krok po kroku mierzalnie poprawia wyniki w trudnych problemach, a modele rozumujące robią dziś domyślnie wewnętrzną wersję tego procesu.
Temperatura
Temperatura to ustawienie kontrolujące, ile losowości model dodaje przy wyborze każdego kolejnego tokena.
Niska temperatura daje spójny, zachowawczy wynik; wysoka daje różnorodność i czasem bzdury. Produkty czatowe zwykle wybierają za ciebie wartość pośrednią.
Streaming
Streaming to wysyłanie przez model odpowiedzi token po tokenie w miarę generowania, zamiast całości naraz po zakończeniu.
Dlatego odpowiedzi wyglądają, jakby same się pisały, i dlatego złą odpowiedź można przerwać wcześniej zamiast czekać do końca.
Regeneruj
Regeneruj oznacza poproszenie o świeżą odpowiedź na ten sam prompt.
Ponieważ generowanie jest probabilistyczne, regeneracja to naprawdę nowe losowanie, a nie ponowna próba tych samych obliczeń. Porównanie dwóch losowań albo tego samego promptu na dwóch modelach to szybki test jakości.
Jak powstają modele
Trening
Trening to proces dostrajania parametrów modelu względem danych, aż jego przewidywania staną się dobre.
Dzieje się to, zanim kiedykolwiek zetkniesz się z modelem, i kosztuje dostawcę ogromną moc obliczeniową. Nic, co wpiszesz w czacie, nie retrenuje modelu na bieżąco, choć dostawcy mogą wykorzystywać rozmowy do trenowania przyszłych wersji, zależnie od swojej polityki.
Dane treningowe
Dane treningowe to tekst i inne materiały, z których uczył się model.
Ich zakres tłumaczy, co model wie, ich luki tłumaczą systematyczne martwe punkty, a ich przedział czasowy ustala datę graniczną wiedzy.
Trening wstępny (pretraining)
Trening wstępny to pierwsza, największa faza treningu, w której model uczy się języka i wiedzy o świecie z masy tekstu.
Wynik jest zdolny, ale surowy. Wszystko, co sprawia, że model zachowuje się jak pomocny asystent, przychodzi później.
Dostrajanie (fine-tuning)
Dostrajanie to dodatkowy trening na węższym zbiorze danych, żeby wyspecjalizować lub ukształtować już wytrenowany model.
Dostawcy dostrajają pod kątem pomocności i bezpieczeństwa; firmy dostrajają pod kątem zadań branżowych. Dla większości użytkowników dobre promptowanie plus zdolny model ogólny biją płacenie za dostrajanie.
RLHF
RLHF, czyli uczenie ze wzmocnieniem na podstawie ludzkiej informacji zwrotnej, to trenowanie modelu na podstawie ludzkich ocen jego odpowiedzi.
To duża część powodu, dla którego współczesni asystenci są uprzejmi, uporządkowani i ostrożni. W nadmiarze produkuje też asekuranctwo, przez które niektóre modele odmawiają albo kluczą.
Alignment (dostosowanie)
Alignment to praca nad dopasowaniem zachowania modelu do ludzkich intencji i wartości.
W praktyce obejmuje wszystko, od odmawiania szkodliwych próśb po zwykłe dokładne wykonywanie poleceń. Gdy model robi coś technicznie imponującego, ale niechcianego, to luka w alignmencie.
Inferencja
Inferencja to uruchamianie wytrenowanego modelu w celu wyprodukowania odpowiedzi, w przeciwieństwie do jego trenowania.
Każda wysłana przez ciebie wiadomość uruchamia inferencję, a koszt inferencji to właśnie to, co mierzą ceny za token. Modele tanie w uruchomieniu potrafią być zaskakująco zdolne; Indeks kosztów modeli AI pokazuje 2000-krotną rozpiętość cen.
Transformer
Transformer to architektura sieci neuronowej stojąca za praktycznie każdym współczesnym modelem językowym.
Jej kluczowy mechanizm, uwaga (attention), pozwala modelowi ważyć każdą część wejścia względem każdej innej. Nigdy nie potrzebujesz szczegółów, ale to słowo jest wszędzie w tekstach o AI.
Gdy coś idzie nie tak
Halucynacja
Halucynacja to model podający coś fałszywego z pełnym przekonaniem.
To nie błąd, który zostanie załatany w następnej aktualizacji; wynika ze sposobu, w jaki działa generowanie. Częstotliwość mocno zależy od modelu i zadania. Traktuj każdy konkretny fakt, liczbę czy cytat jako niesprawdzony, dopóki go nie zweryfikujesz. Dlaczego AI się myli omawia mechanikę tego zjawiska.
Grounding (zakotwiczenie)
Grounding to dostarczenie modelowi wiarygodnego materiału, z którego ma odpowiadać, zamiast pozwalać mu polegać na pamięci.
Wklejenie umowy, załączenie raportu czy włączenie wyszukiwania w internecie to wszystko grounding. To najskuteczniejsza codzienna obrona przed halucynacją.
Bias (stronniczość)
Bias to systematyczne wypaczanie przez model swoich wyników w sposób odziedziczony po danych treningowych.
Objawia się jako założenia dotyczące ludzi, miejsc i ustawień domyślnych. Przy decyzjach o realnych skutkach sprawdzaj wynik AI tak, jak sprawdzałbyś pracę zdolnego, ale niezweryfikowanego stażysty.
Guardrails (bariery ochronne)
Guardrails to ograniczenia, które dostawca buduje wokół modelu, żeby blokować szkodliwe lub niezgodne z polityką wyniki.
Różni dostawcy rysują granice inaczej, co jest realną różnicą między produktami: ta sama prośba może zostać spełniona przez jeden model, a odrzucona przez inny.
Jailbreak
Jailbreak to prompt skonstruowany tak, by oszukać model i skłonić go do zignorowania barier ochronnych.
Dostawcy nieustannie je łatają. Dla zwykłych użytkowników termin ma znaczenie głównie jako pojęcie bezpieczeństwa: cokolwiek da się modelowi wmówić, ktoś spróbuje mu to wmówić.
Red teaming
Red teaming to celowe atakowanie modelu przed premierą, żeby znaleźć szkodliwe tryby awarii.
Dostawcy prowadzą wewnętrzne i zewnętrzne zespoły red team, a opublikowane karty modeli często streszczają, co znaleźli. To odpowiednik testów penetracyjnych w świecie AI.
Data graniczna wiedzy (knowledge cutoff)
Data graniczna wiedzy to data, po której kończą się dane treningowe modelu.
Zapytaj o coś nowszego, a model albo przyzna się do niewiedzy, albo przeszuka internet, jeśli potrafi, albo zacznie halucynować. Znajomość daty granicznej używanego modelu zapobiega całej kategorii błędów.
Wyszukiwanie i twoje dane
RAG (generowanie wspomagane wyszukiwaniem)
RAG, czyli generowanie wspomagane wyszukiwaniem, polega na najpierw pobraniu odpowiednich dokumentów, a potem odpowiadaniu przez model na ich podstawie.
Tak pod maską działają produkty typu "czatuj ze swoją bazą wiedzy", i dlatego mogą podawać źródła. RAG zmniejsza ryzyko halucynacji, ale dziedziczy jakość tego, co pobiera.
Embedding (osadzenie)
Embedding to lista liczb reprezentująca znaczenie fragmentu tekstu.
Teksty o podobnym znaczeniu dostają zbliżone liczby, co pozwala oprogramowaniu matematycznie znajdować powiązane fragmenty. Embeddingi to mechanizm stojący za wyszukiwaniem semantycznym i RAG.
Baza wektorowa
Baza wektorowa to baza danych zbudowana do przechowywania embeddingów i szybkiego znajdowania tych najbliższych.
Jeśli produkt mówi, że "zindeksował" twoje dokumenty pod wyszukiwanie AI, to embedding dla każdego fragmentu siedzi właśnie w jednej z takich baz.
Wyszukiwanie semantyczne
Wyszukiwanie semantyczne to znajdowanie tekstu po znaczeniu, a nie po dopasowaniu słów kluczowych.
Wyszukanie "problemy finansowe" może wydobyć fragment o napięciach w przepływach pieniężnych, mimo że żadne słowo się nie zgadza. To embeddingi w akcji.
Chunking (dzielenie na fragmenty)
Chunking to dzielenie długich dokumentów na kawałki na tyle małe, by dobrze je osadzić i pobierać.
Brzmi jak hydraulika i faktycznie nią jest, ale słaby chunking to częsty powód, dla którego narzędzia do czatu z dokumentami odpowiadają na podstawie niewłaściwej części pliku.
Wyszukiwanie w internecie (w AI)
Wyszukiwanie w internecie w AI oznacza, że model pobiera aktualne strony przed odpowiedzią, zamiast polegać na pamięci treningowej.
Wymienia szybkość na aktualność i pozwala odpowiedziom nosić cytowania, które możesz otworzyć. Przy wszystkim, co jest po dacie granicznej wiedzy modelu, to różnica między odpowiedzią a zgadywaniem.
Baza wiedzy
Baza wiedzy to wyselekcjonowany zbiór dokumentów, który firma daje swojej AI, żeby mogła na ich podstawie odpowiadać.
Jaka jakość na wejściu, taka na wyjściu: asystent oparty na nieaktualnej wiki pewnie serwuje nieaktualne odpowiedzi, wraz z cytowaniami.
Trzy pojęcia w tym słowniku nazywają konkurencyjne odpowiedzi na to samo pytanie, jak sprawić, żeby model lepiej radził sobie z twoim zadaniem, a mylenie ich to najczęstszy żargonowy błąd na spotkaniach produktowych. Obok siebie:
| Podejście | Co się zmienia | Koszt i szybkość | Kiedy wygrywa |
|---|---|---|---|
| Lepsze promptowanie (zero-shot, few-shot) | Tylko tekst, który wysyłasz | Darmowe, zajmuje minuty | Niemal zawsze pierwszy ruch; dwa lub trzy gotowe przykłady naprawiają większość problemów z formatowaniem |
| RAG | To, co model czyta przed odpowiedzią | Umiarkowany koszt budowy, bez ponownego treningu | Odpowiedzi, które muszą być aktualne albo cytować twoje własne dokumenty |
| Dostrajanie | Same parametry modelu | Wolne i kosztowne, potem stałe | Stabilne wymagania co do stylu i formatu na dużą skalę, niemal nigdy dla pojedynczej osoby |
Poza tekstem
Multimodalność
Multimodalność oznacza model działający na więcej niż jednym medium, na przykład tekst plus obrazy, dźwięk albo wideo.
Dlatego możesz zrobić zrzut ekranu z błędem i zapytać, co jest nie tak. Przewodnik po multimodalnym AI omawia, co naprawdę działa dzisiaj.
Model wizyjny
Model wizyjny to model potrafiący interpretować obrazy: zdjęcia, zrzuty ekranu, wykresy i dokumenty.
Odczytywanie to nie to samo co generowanie; model może idealnie opisać twój diagram, a mimo to nie potrafić go narysować.
Generowanie obrazów
Generowanie obrazów to tworzenie nowych obrazów na podstawie opisu tekstowego.
Jakość, zakres stylów i renderowanie tekstu wewnątrz obrazów mocno różnią się między generatorami, dlatego poważni użytkownicy porównują kilka. Zestawienie generatorów obrazów jest na bieżąco z tą dziedziną.
Model dyfuzyjny
Model dyfuzyjny generuje obrazy, zaczynając od szumu i stopniowo dopracowując go w kierunku opisu.
To dominująca technika stojąca za współczesnymi generatorami obrazów. To słowo ma znaczenie głównie po to, żeby "dyfuzja" w nazwie produktu mówiła ci, co produkt robi.
Zamiana mowy na tekst
Zamiana mowy na tekst to transkrybowanie mówionego dźwięku na pisane słowa.
Współczesna transkrypcja jest na tyle dokładna, że umożliwia przeszukiwanie spotkań, notatek głosowych i wywiadów, i tak właśnie działa wprowadzanie głosowe w aplikacjach czatu.
Zamiana tekstu na mowę
Zamiana tekstu na mowę to generowanie mówionego dźwięku z pisanych słów.
Współczesne systemy produkują naturalne, ekspresyjne głosy, co napędza funkcje czytania na głos i głosowe rozmowy z AI.
Ekosystem
API
API to programistyczne drzwi, przez które deweloperzy wysyłają prompty do modelu z własnego oprogramowania.
Ceny API liczone są za token, i stąd ostatecznie bierze się ekonomika kosztu pojedynczej odpowiedzi w każdym produkcie AI.
Otwarte wagi
Otwarte wagi oznaczają, że wytrenowane parametry modelu są publikowane, żeby każdy mógł je pobrać i uruchomić.
Umożliwia to samodzielny hosting i pozwala innym dostawcom serwować model na własnej infrastrukturze. DeepSeek i Llama to znane przykłady.
Model open source
Model open source to, w uproszczeniu, model udostępniony do publicznego użytku i modyfikacji, choć licencje mocno się różnią.
Praktyczne pytania są zawsze te same dwa: czy możesz go używać komercyjnie i kto hostuje go dla ciebie. Ekosystem otwartych wag ma największe znaczenie, gdy prywatność albo koszt wykluczają hostowane flagowce.
Benchmark
Benchmark to standardowy test używany do oceniania i porównywania modeli.
Przydatny do wstępnej selekcji, rutynowo nadużywany w marketingu. Model, który wygrywa benchmark, wciąż może przegrać przy twojej rzeczywistej pracy, dlatego przeprowadzenie własnego porównania na trzech zadaniach bije czytanie wykresów.
Agent
Agent to system AI, który podejmuje kroki działania w kierunku celu, zamiast tylko raz odpowiedzieć.
Rezerwacje, research, kodowanie i zgłaszanie ticketów to terytorium agentów. Ta zdolność jest realna i szybko się poprawia; podobnie jak potrzeba sprawdzania, co agent zrobił, zanim to zacznie mieć znaczenie.
Korzystanie z narzędzi
Korzystanie z narzędzi, czyli function calling, to wywoływanie przez model zewnętrznych możliwości, takich jak wyszukiwarka, kalkulator, kod czy twój kalendarz.
Tak asystenci czatu działają na świecie, zamiast tylko go opisywać, i to jest mechanizm leżący u podstaw agentów.
Model rozumujący
Model rozumujący to taki, który zużywa dodatkową moc obliczeniową na wewnętrzne przemyślenie problemu, zanim odpowie.
Zamienia czas i koszt na dokładność w trudnych problemach. Przy prostych pytaniach dodatkowe myślenie niczego nie daje, co jest kolejnym argumentem za zmianą modelu w zależności od zadania.
Opóźnienie (latency)
Opóźnienie to czas, jaki czekasz między wysłaniem promptu a nadejściem odpowiedzi albo rozpoczęciem jej strumieniowania.
Zależy od rozmiaru modelu, obciążenia i tego, czy model jest modelem rozumującym. Przy pracy interaktywnej szybki, wystarczająco dobry model często bije wolny, znakomity.
Limit szybkości (rate limit)
Limit szybkości to pułap, jaki dostawca nakłada na liczbę żądań lub tokenów, których możesz użyć w danym oknie czasowym.
Osiągnięcie go to zwykły powód, dla którego produkt czatowy każe ci poczekać albo zaktualizować plan. Limity wiadomości w planach subskrypcyjnych to limity szybkości pod bardziej przyjazną nazwą.
Jak ten słownik pozostaje przydatny
Pojęcia w tej dziedzinie starzeją się szybko. Ta strona jest utrzymywana jako materiał referencyjny: hasła są przepisywane, gdy zmienia się sposób ich użycia, a linkowane pogłębione przewodniki niosą szczegóły, które nie mieszczą się w definicji.
Jeśli natrafisz gdzieś na pojęcie, którego tu brakuje, najszybszą drogą jest wklejenie zdania, w którym je znalazłeś, do zdolnego modelu i poproszenie o definicję w kontekście. W Whizi możesz zapytać dwa modele naraz i zauważyć, kiedy się nie zgadzają, co przy nowym żargonie zdarza się zaskakująco często.
- Zacytuj jednozdaniową definicję; przeczytaj szczegół, zanim na niej polegniesz
- Gdy dwa źródła różnie definiują pojęcie, w AI zwykle wygrywa nowsze użycie
- Naucz się najpierw tokena, okna kontekstowego i halucynacji; większość innych pojęć zależy od tej trójki
- Sprawdzaj nieznane twierdzenia o modelu za pomocą własnego porównania na trzech zadaniach
- Skorzystaj najpierw ze słownika dla początkujących, jeśli ta strona wydaje się instrukcją referencyjną, bo właśnie nią jest
Najczęstsze pytania
Jaka jest różnica między AI, uczeniem maszynowym a LLM?
AI to szeroki cel: oprogramowanie wykonujące zadania wymagające ludzkiego osądu. Uczenie maszynowe to technika uczenia oprogramowania na przykładach, i tak właśnie zbudowana jest zasadniczo cała współczesna AI. LLM to jeden rodzaj modelu uczonego maszynowo, trenowanego na tekście, i to właśnie ten rodzaj stoi za ChatGPT, Claude i Gemini.
Co znaczy RAG w AI?
RAG to skrót od generowania wspomaganego wyszukiwaniem: system najpierw pobiera odpowiednie dokumenty, a potem model odpowiada na ich podstawie, a nie z pamięci. To standardowa technika stojąca za produktami, które czatują z twoimi plikami albo bazą wiedzy, i dlatego te produkty mogą podawać źródła.
Jaka jest różnica między dostrajaniem a RAG?
Dostrajanie zmienia sam model przez dodatkowy trening, co jest wolne i daje stały wynik. RAG zostawia model w spokoju i podaje mu odpowiednie dokumenty w momencie pytania, co jest elastyczne i aktualne. Żeby utrzymać asystenta na bieżąco ze zmieniającymi się informacjami, RAG jest niemal zawsze właściwym narzędziem; dostrajanie pasuje do stabilnych wymagań co do stylu i formatu.
Czym jest token w AI?
Token to jednostka tekstu, którą model czyta i pisze, mniej więcej trzy czwarte angielskiego słowa. Wszystko jest mierzone w tokenach: ceny, szybkość i okno kontekstowe. Dokument liczący 1000 słów to około 1300 tokenów.
Ile z tych pojęć naprawdę muszę znać?
Do codziennego użytku około pięciu: model, prompt, token, okno kontekstowe i halucynacja. Wersja tego słownika dla początkujących omawia je z większą cierpliwością. Reszta tej strony istnieje na moment, gdy strona produktu albo artykuł rzuci w ciebie jakimś pojęciem.