Co je Llama
Llama je řada AI modelů od Mety, firmy stojící za Facebookem a Instagramem, a Llama 3 je generace, kterou Meta vypustila v roce 2024. Stejně jako u ChatGPT a Claude napíšete otázku a dostanete odpověď. Zajímavé není to, co dělá, ale jak se distribuuje.
Většina AI modelů je uzamčená uvnitř produktu svého tvůrce. ChatGPT používáte přes OpenAI a samotný model nikdy neopustí jejich servery. Meta zveřejňuje váhy Llamy, tedy čísla, ze kterých se natrénovaný model skládá, aby si je kdokoliv mohl stáhnout a spustit.
Užitečné přirovnání: většina AI je restaurace, kde si objednáte a oni uvaří. Llama je blíž zveřejněnému receptu. Můžete se najíst v restauraci, ale zároveň si to můžete uvařit sami, upravit podle sebe nebo otevřít vlastní kuchyni.
Jedna věc, o které se na internetu často diskutuje. Llama bývá označována jako open source, přesně vzato jde ale o „open weights“ s licencí, která nese určité podmínky, včetně omezení pro velmi rozsáhlé komerční využití. Pro jednotlivce to v praxi nic nemění. Pro firmu, která na ní staví produkt, se licenci vyplatí přečíst.
Proč na tom záleží, i když si nic nestáhnete
K běžným uživatelům se dostávají tři důsledky.
Je levná, a tak je všude. Protože ji může hostovat kdokoliv, konkurence tlačí cenu dolů. Hostovaná Llama 3.3 70B stojí přibližně $0.10 za milion vstupních tokenů a $0.32 za milion výstupních tokenů podle srpnového Indexu cen AI modelů z roku 2026, zatímco Claude Opus 5 účtuje za stejné tokeny $5 a $25. Modely Llama pohánějí velkou část AI, se kterou se setkáváte v jiných produktech, aniž by to bylo takto označené, a bývají tím, co si služba představí pod rychlým nebo úsporným tarifem.
Umí fungovat bez internetu. Model na vašem vlastním počítači funguje v letadle, v zabezpečeném prostředí nebo kdekoliv, odkud data nesmí odejít. Žádná hostovaná služba to nabídnout nemůže.
Udržuje trh čestný. Schopná zdarma dostupná varianta dává strop tomu, kolik si mohou účtovat uzavřené modely, což je dobré pro vás bez ohledu na to, co používáte.
V čem je Llama skutečně dobrá
Upřímnost v tomto ohledu je užitečnější než nadšení. Llama existuje v několika velikostech a kompromis je vždy stejný: menší modely jsou extrémně rychlé a levné, větší jsou schopnější, ale provoz už není levný.
| Úkol | Llama | Lepší volba jinde |
|---|---|---|
| Rychlé faktické otázky | Rychlá a dostatečně dobrá | Ne |
| Krátké seznamy, brainstorming, jednoduché přepisy | Velmi dobrá a okamžitá | Ne |
| Opakovaná práce na velkém množství položek | Ideální, protože záleží na ceně za položku | Ne |
| Vše, co musí běžet offline nebo soukromě | Jediná reálná možnost | Ne |
| Text, který si člověk přečte od začátku do konce | Použitelná | Claude, znatelně |
| Složité vícekrokové uvažování | Slabší než špičkové modely | GPT nebo Claude |
| Velmi dlouhé dokumenty | Omezená | Gemini |
| Cokoliv z posledních týdnů | To nezná | Model s přístupem na web |
Vzorec je jasný: skvělá pro objem a rychlost, konkurenceschopná u běžných dotazů a pozadu za špičkovými modely ve složitém uvažování a vybroušeném psaní. Za něco zdarma je to slušný kompromis, a proto je otázka „co je lepší“ položená špatně. Používejte ji tam, kde záleží na rychlosti a ceně, a přepněte, když je úkol náročný.
Tři způsoby, jak ji používat
1. Přes pracovní prostředí, bez jakéhokoliv nastavování. Nejjednodušší varianta. Llama je součástí Whizi vedle GPT, Claude a Gemini, zpráva Llamě stojí 1 kredit tam, kde zpráva Claude Opus 5 stojí 20, takže rychlé otázky jdou na Llamu a na silnější model přepnete ve stejné konverzaci, když úkol zesložití. Nic se neinstaluje.
2. Na vlastním počítači. Nástroje jako Ollama a LM Studio stáhnou model a spustí ho lokálně. Reálné očekávání: potřebujete přiměřeně výkonný počítač s dostatkem paměti, pohodlně běží spíš menší modely a odpovědi budou pomalejší než u hostované služby, pokud nemáte dobrou grafickou kartu. Výměnou za to nic z toho, co napíšete, neopustí váš počítač a funguje to i bez internetu. Vyplatí se to, pokud je požadavkem soukromí nebo offline provoz, jinak je to zbytečné.
3. Přes API. Pokud vyvíjíte software, poskytovatelé hostují Llamu za velmi nízkou cenu za token, což bývá důvod ji zvolit místo špičkového modelu u úkolů s velkým objemem.
Jak z ní dostat lepší odpovědi
Menší modely odměňují jiný styl zadávání než ty špičkové. Tři návyky dělají velký rozdíl.
Buďte přímí a konkrétní. Vypiš 10 nápadů na název kavárny, jeden na řádek, bez vysvětlování funguje lépe než konverzační žádost. Menší modely dobře plní jednoduché explicitní pokyny a u propracovaných instrukcí sklouzávají.
Jedna věc po druhé. Špičkové modely zvládnou šest podmínek v jednom promptu. Menší modely fungují lépe s posloupností jednotlivých požadavků.
Řekněte formát. Odpověz jednou větou nebo vrať pouze číslovaný seznam zabrání vatě, kterou menší modely produkují, když si nejsou jisté.
A poznejte, kdy přepnout. Pokud je odpověď vágní, sama si odporuje nebo přehlédne něco zjevného, je to signál k přesunutí stejné otázky na silnější model, ne k dalšímu přeformulovávání. V pracovním prostředí, které jich drží víc, jde o jedno kliknutí a konverzace pokračuje dál.
Na co si dát pozor
Neví, co se stalo nedávno. Její znalosti končí datem trénování a pokud není napojená na vyhledávání, na otázku o minulém měsíci odpoví ze svých obecných znalostí, a to sebejistě.
Vymýšlí si, jako každý model. Menší modely to dělají o něco víc. Ověřte si každý konkrétní fakt, datum nebo číslo.
Zdarma neznamená soukromé, pokud je hostovaná. Provoz Llamy na vlastním počítači je soukromý. Používání přes cizí službu znamená, že platí jejich zásady o datech, přesně jako u kteréhokoliv jiného modelu.
Záměna verzí. Llama 3 byla jedna generace a od té doby vyšly novější verze, včetně řady Llama 4 s variantami Scout a Maverick. Pokud na tom záleží, zeptejte se, kterou verzi používáte, protože rozdíly jsou velké: Llama 4 Maverick drží kontext 1 milion tokenů, zatímco Llama 3.3 jen 131K, tedy zhruba 100 000 slov.
- Používejte ji na rychlé dotazy, krátké seznamy a opakující se úkoly, kde záleží na rychlosti
- Přepněte na silnější model, když úkol vyžaduje pečlivé uvažování nebo vybroušený text
- Zadávejte přímo, jednu věc po druhé, a uveďte požadovaný formát výstupu
- Spouštějte ji lokálně jen tehdy, pokud opravdu potřebujete offline nebo soukromé použití
- Ověřujte si každý konkrétní fakt, datum nebo číslo, jako u kteréhokoliv modelu
- Zeptejte se, kterou verzi používáte, protože se generace hodně liší
Časté dotazy
Musím si stahovat software, abych mohl(a) Llamu 3 používat?
Ne. Stažení a lokální provoz je jedna z možností a je to ta správná volba, pokud potřebujete offline nebo plně soukromé použití, vyžaduje to ale přiměřeně výkonný počítač a odpovědi jsou pomalejší než u hostované služby. Většina lidí ji používá přes platformu v prohlížeči, kde stojí vedle dalších modelů a nevyžaduje žádné nastavování.
Je Llama 3 rychlejší než ChatGPT?
Menší modely Llama jsou znatelně rychlejší, což z nich dělá skvělou volbu pro krátké otázky, rychlé seznamy a cokoliv opakujícího se. Kompromisem jsou schopnosti: ve složitém uvažování a vybroušeném psaní jsou špičkové modely jasně lepší. Rozumný přístup je používat Llamu kvůli rychlosti a přepnout, jakmile se otázka ukáže náročnější, než vypadala.
Je Llama opravdu zdarma?
Váhy modelu jsou zdarma ke stažení a licence povoluje většinu způsobů použití, s určitými podmínkami, které se týkají hlavně velmi rozsáhlého komerčního nasazení. Provoz zdarma v praxi není, protože stojí buď vlastní hardware a elektřinu, nebo poplatek hostujícího poskytovatele za token, který je ale výrazně nižší než u špičkových modelů.
Je to soukromé, když ji spustím na vlastním počítači?
Ano, a je to nejsilnější důvod ji provozovat lokálně. Nic, co napíšete, neopustí váš počítač, funguje to i bez připojení k internetu a neplatí žádné zásady poskytovatele, protože žádný poskytovatel není zapojen. Cenou je nastavení, počítač s dostatkem paměti, pomalejší odpovědi bez dobré grafické karty a omezení na menší modely, které běží pohodlně.
Mám používat Llamu místo ChatGPT nebo Claude?
Místo, málokdy. Vedle, často. Je to správná volba pro rychlé jednoduché otázky, objemnou opakující se práci a cokoliv, co musí běžet soukromě nebo offline. Pro text, který si někdo pečlivě přečte, pro náročné vícekrokové uvažování a pro velmi dlouhé dokumenty jsou špičkové modely citelně lepší. Mít k dispozici obojí znamená, že volbu děláte podle úkolu, ne jako trvalý závazek.