Hva Llama 3 er
Llama er en familie av AI-modeller bygget av Meta, selskapet bak Facebook og Instagram, og Llama 3 er generasjonen Meta lanserte i 2024. Akkurat som ChatGPT og Claude skriver du et spørsmål og den svarer. Det interessante er ikke hva den gjør, men hvordan den distribueres.
De fleste AI-modeller er låst inne i produktet til den som lager dem. Du bruker ChatGPT gjennom OpenAI, og selve modellen forlater aldri serverne deres. Meta gir ut Llamas vekter, som er tallene som utgjør den trente modellen, slik at alle kan laste dem ned og kjøre dem.
En nyttig sammenligning: de fleste AI-er er som en restaurant der du bestiller og de lager maten. Llama ligner mer på å publisere oppskriften. Du kan fortsatt spise på restauranten, men du kan også lage maten selv, tilpasse den, eller åpne ditt eget kjøkken.
En presisering du vil se diskutert på nettet. Llama omtales gjerne som open source, men strengt tatt er det "åpne vekter" med en lisens som har enkelte betingelser, inkludert begrensninger på svært storskala kommersiell bruk. For en enkeltperson har det ingen praktisk betydning. For et selskap som bygger et produkt på det, er lisensen verdt å lese.
Hvorfor det betyr noe selv om du aldri laster ned noe
Tre konsekvenser når vanlige brukere.
Den er billig, så den er overalt. Fordi alle kan hoste den, presser konkurransen prisen ned. Hostet Llama 3.3 70B koster rundt $0.10 per million input-tokens og $0.32 per million output-tokens i AI Model Cost Index fra august 2026, der Claude Opus 5 tar $5 og $25 for de samme tokenene. Llama-modeller driver en stor del av AI-en du møter i andre produkter uten at det er merket, og det er ofte det en tjeneste mener med et raskt eller rimelig nivå.
Den kan kjøre uten internett. En modell på din egen maskin fungerer på et fly, i et sikkert miljø, eller hvor som helst data ikke skal forlate bygningen. Ingen hostet tjeneste kan tilby det.
Den holder markedet ærlig. Et kapabelt gratisalternativ setter et tak på hva lukkede modeller kan ta betalt for, noe som er bra for deg uansett hva du bruker.
Hva den faktisk er god til
Å være ærlig om dette er mer nyttig enn entusiasme. Llama kommer i flere størrelser, og avveiningen er konsekvent: mindre modeller er ekstremt raske og billige, større er mer kapable men ikke lenger billige å kjøre.
| Oppgave | Llama | Bedre andre steder |
|---|---|---|
| Raske faktaspørsmål | Rask og god nok | Nei |
| Korte lister, idémyldring, enkle omskrivninger | Veldig god, og øyeblikkelig | Nei |
| Repeterende arbeid på mange elementer | Ideell, fordi kostnad per element betyr noe | Nei |
| Alt som må kjøres offline eller privat | Det eneste reelle alternativet | Nei |
| Tekst en person skal lese fra start til slutt | Brukbar | Claude, merkbart |
| Kompleks resonnering i flere trinn | Svakere enn frontlinjen | GPT eller Claude |
| Svært lange dokumenter | Begrenset | Gemini |
| Alt fra de siste ukene | Vet den ikke | En modell med nettilgang |
Mønsteret: utmerket for volum og hastighet, konkurransedyktig på hverdagsspørsmål, og bak frontlinjemodellene på vanskelig resonnering og polert skriving. Det er et rimelig bytte for noe gratis, og det er derfor "hvilken er best" er feil spørsmål. Bruk den der hastighet og kostnad betyr noe, og bytt når oppgaven blir vanskelig.
Tre måter å bruke den på
1. Gjennom et arbeidsområde, uten oppsett. Det enkleste alternativet. Llama er inkludert i Whizi sammen med GPT, Claude og Gemini, og en Llama-melding koster 1 kreditt der en Claude Opus 5-melding koster 20, så de raske spørsmålene går til Llama og du bytter til en sterkere modell i samme samtale når oppgaven blir vanskeligere. Ingenting å installere.
2. På din egen datamaskin. Verktøy som Ollama og LM Studio laster ned en modell og kjører den lokalt. Realistiske forventninger: du trenger en rimelig moderne maskin med god minnekapasitet, de mindre modellene er de som kjører komfortabelt, og svarene blir tregere enn en hostet tjeneste med mindre du har en god GPU. Til gjengjeld forlater ingenting du skriver maskinen din, og det fungerer uten internett. Genuint verdt det hvis personvern eller offline bruk er kravet, og unødvendig ellers.
3. Gjennom et API. Hvis du bygger programvare, hoster leverandører Llama til svært lav kostnad per token, som ofte er grunnen til å velge den fremfor en frontlinjemodell for oppgaver med høyt volum.
Slik får du gode svar ut av den
Mindre modeller belønner en annen skrivestil enn frontlinjemodellene. Tre vaner utgjør en stor forskjell.
Vær direkte og spesifikk. List 10 navneforslag til en kaffebar, en linje hver, ingen forklaringer fungerer bedre enn en samtalepreget forespørsel. Mindre modeller følger enkle, eksplisitte instruksjoner godt og sporer av på kompliserte.
Én ting av gangen. Frontlinjemodeller håndterer seks krav i én forespørsel. Mindre modeller gjør det bedre med en rekke enkeltforespørsler.
Si formatet. Svar i én setning eller returner bare en nummerert liste forhindrer utfyllingen mindre modeller produserer når de er usikre.
Og vit når du skal bytte. Hvis et svar er vagt, motsier seg selv, eller mangler noe åpenbart, er det signalet på å flytte det samme spørsmålet til en sterkere modell fremfor å fortsette å omformulere. I et arbeidsområde som har flere, er dette ett klikk, og samtalen følger med.
Hva du bør være forsiktig med
Den vet ikke hva som skjedde nylig. Kunnskapen stopper på treningsdatoen, og med mindre den er koblet til søk, vil den svare på et spørsmål om forrige måned basert på generell kunnskap, med selvsikkerhet.
Den dikter opp ting, som alle modeller. Mindre modeller gjør det noe mer. Sjekk alle spesifikke fakta, datoer eller tall.
Gratis betyr ikke privat, hvis den er hostet. Å kjøre Llama på din egen maskin er privat. Å bruke den gjennom noens tjeneste betyr at deres personvernpolicy gjelder, akkurat som med enhver annen modell.
Versjonsforvirring. Llama 3 var én generasjon, og nyere versjoner har kommet siden, inkludert Llama 4-linjen med sine Scout- og Maverick-varianter. Spør hvilken versjon du bruker hvis det er viktig, fordi forskjellene er store: Llama 4 Maverick har et kontekstvindu på 1 million tokens der Llama 3.3 har 131K, omtrent 100 000 ord.
- Bruk den til raske spørsmål, korte lister og repeterende oppgaver der hastighet betyr noe
- Bytt til en sterkere modell når oppgaven krever nøye resonnering eller polert skriving
- Hold forespørslene direkte, én av gangen, og angi utdataformatet
- Kjør den lokalt bare hvis du faktisk trenger offline eller privat bruk
- Sjekk alle spesifikke fakta, datoer eller tall, som med enhver modell
- Spør hvilken versjon du bruker, siden generasjonene er svært ulike
Vanlige spørsmål
Må jeg laste ned programvare for å bruke Llama 3?
Nei. Å laste ned og kjøre den lokalt er ett alternativ, og det er det riktige valget hvis du trenger offline eller helt privat bruk, men det krever en rimelig kraftig maskin og gir tregere svar enn en hostet tjeneste. De fleste bruker den gjennom en plattform i nettleseren, der den ligger side om side med andre modeller og krever ingen oppsett i det hele tatt.
Er Llama 3 raskere enn ChatGPT?
De mindre Llama-modellene er merkbart raskere, noe som gjør dem utmerket for korte spørsmål, raske lister og alt repeterende. Avveiningen er kapasitet: på kompleks resonnering og polert skriving er frontlinjemodellene tydelig bedre. Den fornuftige tilnærmingen er å bruke Llama for hastighet og bytte når et spørsmål viser seg å være vanskeligere enn det så ut.
Er Llama virkelig gratis?
Modellvektene er gratis å laste ned, og lisensen tillater de fleste bruksområder, med enkelte betingelser som først og fremst gjelder svært storskala kommersielle utrullinger. Å kjøre den er ikke gratis i praksis, siden det koster enten din egen maskinvare og strøm eller en hostet leverandørs pris per token, som rett og slett er mye lavere enn det frontlinjemodellene tar betalt for.
Er det privat hvis jeg kjører den på min egen datamaskin?
Ja, og det er den sterkeste grunnen til å kjøre den lokalt. Ingenting du skriver forlater maskinen din, den fungerer uten internett, og ingen leverandørpolicy gjelder fordi ingen leverandør er involvert. Kostnadene er oppsettarbeid, en maskin med nok minne, tregere svar uten en god GPU, og at du er begrenset til de mindre modellene som kjører komfortabelt.
Bør jeg bruke Llama i stedet for ChatGPT eller Claude?
I stedet for, sjelden. Ved siden av, ofte. Den er riktig valg for raske, enkle spørsmål, repeterende arbeid i høyt volum, og alt som må kjøres privat eller offline. For tekst noen skal lese nøye, for vanskelig resonnering i flere trinn, og for svært lange dokumenter, er frontlinjemodellene merkbart bedre. Å ha begge tilgjengelig betyr at valget tas per oppgave i stedet for å være en fast beslutning.