Llama là gì
Llama là một họ mô hình AI do Meta xây dựng, công ty đứng sau Facebook và Instagram. Giống ChatGPT và Claude, bạn gõ một câu hỏi và nó trả lời. Điểm thú vị không nằm ở việc nó làm gì mà ở cách nó được phân phối.
Phần lớn mô hình AI bị khóa bên trong sản phẩm của nhà sản xuất. Bạn dùng ChatGPT thông qua OpenAI, và bản thân mô hình không bao giờ rời khỏi máy chủ của họ. Meta thì phát hành trọng số của Llama, tức là những con số cấu thành mô hình đã huấn luyện, cho bất kỳ ai tải về và chạy.
Một ví von hữu ích: đa số AI giống một nhà hàng, bạn gọi món và họ nấu. Llama gần với việc công bố công thức nấu ăn hơn. Bạn vẫn có thể ăn ở nhà hàng, và bạn cũng có thể tự nấu, chỉnh sửa theo ý mình, hoặc mở bếp riêng.
Một điểm cần nói rõ mà bạn sẽ thấy tranh cãi trên mạng. Llama thường được mô tả là mã nguồn mở, còn nói chặt chẽ thì nó là "trọng số mở" với một giấy phép kèm vài điều kiện, trong đó có hạn chế về việc dùng thương mại ở quy mô rất lớn. Với một cá nhân thì điều này không khác gì trên thực tế. Với một công ty đang xây sản phẩm trên nền nó, giấy phép đáng để đọc.
Vì sao điều đó quan trọng dù bạn chẳng tải gì về
Có ba hệ quả chạm tới người dùng bình thường.
Nó rẻ, nên nó có mặt khắp nơi. Vì ai cũng có thể tự chạy, cạnh tranh kéo chi phí xuống. Các mô hình Llama vận hành một phần lớn lượng AI bạn gặp trong những sản phẩm khác mà không hề ghi tên, và chúng thường chính là thứ mà một dịch vụ ám chỉ khi nói tới gói nhanh hoặc gói tiết kiệm.
Nó chạy được không cần internet. Một mô hình nằm trên máy của bạn vẫn làm việc trên máy bay, trong môi trường bảo mật, hoặc bất cứ nơi nào dữ liệu không được phép rời khỏi tòa nhà. Không dịch vụ trực tuyến nào làm được điều đó.
Nó giữ cho thị trường tử tế. Một lựa chọn miễn phí đủ năng lực đặt ra mức trần cho giá mà các mô hình đóng có thể thu, và điều đó tốt cho bạn bất kể bạn đang dùng gì.
Nó thực sự giỏi ở điều gì
Thành thật về chuyện này hữu ích hơn là hào hứng. Llama có nhiều kích cỡ, và sự đánh đổi luôn nhất quán: mô hình nhỏ thì cực nhanh và rẻ, mô hình lớn thì mạnh hơn nhưng không còn rẻ để chạy.
| Công việc | Llama | Nơi khác tốt hơn |
|---|---|---|
| Câu hỏi dữ kiện nhanh | Nhanh và đủ tốt | Không |
| Danh sách ngắn, nghĩ ý tưởng, viết lại đơn giản | Rất tốt, và tức thì | Không |
| Việc lặp đi lặp lại trên nhiều mục | Lý tưởng, vì chi phí mỗi mục là quan trọng | Không |
| Việc cần chạy ngoại tuyến hoặc riêng tư | Lựa chọn duy nhất | Không |
| Bài viết người ta đọc từ đầu đến cuối | Dùng được | Claude, thấy rõ |
| Suy luận nhiều bước phức tạp | Yếu hơn nhóm dẫn đầu | GPT hoặc Claude |
| Tài liệu cực dài | Hạn chế | Gemini |
| Chuyện xảy ra vài tuần gần đây | Nó không biết | Mô hình có truy cập web |
Quy luật là vậy: xuất sắc về khối lượng và tốc độ, ngang ngửa với các câu hỏi hằng ngày, và thua nhóm dẫn đầu ở suy luận khó cùng lối viết trau chuốt. Đó là cái giá công bằng cho một thứ miễn phí, và cũng là lý do câu hỏi "cái nào tốt hơn" là câu hỏi sai. Hãy dùng nó ở chỗ tốc độ và chi phí quan trọng, rồi đổi mô hình khi công việc trở nên khó.
Ba cách dùng nó
1. Qua một không gian làm việc, không cần cài đặt. Đây là cách đơn giản nhất. Llama có sẵn trong Whizi bên cạnh GPT, Claude và Gemini, nên bạn gửi các câu hỏi nhanh cho nó rồi chuyển sang một mô hình mạnh hơn ngay trong cùng cuộc trò chuyện khi công việc khó lên. Không phải cài gì cả.
2. Trên máy tính của chính bạn. Các công cụ như Ollama và LM Studio tải mô hình về và chạy ngay tại máy. Kỳ vọng thực tế: bạn cần một máy tương đối hiện đại với nhiều bộ nhớ, các mô hình nhỏ mới là loại chạy thoải mái, và câu trả lời sẽ chậm hơn dịch vụ trực tuyến trừ khi bạn có card đồ họa tốt. Đổi lại, không gì bạn gõ ra rời khỏi máy, và nó vẫn chạy khi tắt internet. Thật sự đáng nếu yêu cầu của bạn là quyền riêng tư hoặc dùng ngoại tuyến, còn không thì không cần thiết.
3. Qua API. Nếu bạn đang xây dựng phần mềm, nhiều nhà cung cấp chạy sẵn Llama với chi phí trên mỗi token rất thấp, và đó thường là lý do chọn nó thay vì một mô hình dẫn đầu cho các tác vụ khối lượng lớn.
Cách moi được câu trả lời tốt từ nó
Mô hình nhỏ hợp với một lối viết prompt khác so với nhóm dẫn đầu. Ba thói quen tạo ra khác biệt lớn.
Hãy trực tiếp và cụ thể. Câu Liệt kê 10 ý tưởng tên cho một quán cà phê, mỗi ý một dòng, không giải thích hiệu quả hơn một yêu cầu kiểu trò chuyện. Mô hình nhỏ theo sát các chỉ dẫn đơn giản và rõ ràng, còn với chỉ dẫn rườm rà thì nó trôi lệch.
Mỗi lần một việc. Mô hình dẫn đầu ôm được sáu ràng buộc trong một prompt. Mô hình nhỏ làm tốt hơn với một chuỗi yêu cầu, mỗi lần một yêu cầu.
Nói rõ định dạng. Câu Trả lời trong một câu hoặc chỉ trả về một danh sách đánh số ngăn được kiểu nói lan man mà mô hình nhỏ hay sinh ra khi không chắc chắn.
Và hãy biết lúc nào cần đổi. Nếu một câu trả lời mơ hồ, tự mâu thuẫn, hoặc bỏ sót điều hiển nhiên, đó là tín hiệu nên chuyển đúng câu hỏi ấy sang một mô hình mạnh hơn thay vì cứ diễn đạt lại. Trong một không gian làm việc có sẵn vài mô hình, việc này chỉ một cú nhấp và cuộc trò chuyện được giữ nguyên.
Những điều cần cẩn thận
Nó không biết chuyện gần đây. Kiến thức của nó dừng ở thời điểm huấn luyện, và trừ khi được nối với công cụ tìm kiếm, nó sẽ trả lời câu hỏi về tháng trước bằng kiến thức chung, một cách rất tự tin.
Nó bịa, như mọi mô hình. Mô hình nhỏ bịa nhiều hơn một chút. Hãy kiểm tra mọi dữ kiện, ngày tháng hay con số cụ thể.
Miễn phí không có nghĩa là riêng tư, nếu nó chạy trên máy chủ người khác. Chạy Llama trên máy của chính bạn thì riêng tư. Dùng nó qua dịch vụ của ai đó nghĩa là chính sách dữ liệu của họ được áp dụng, đúng như với mọi mô hình khác.
Nhầm lẫn giữa các phiên bản. Llama đã trải qua nhiều thế hệ, và những bản mới hơn liên tục ra mắt. Hãy hỏi xem bạn đang dùng phiên bản nào nếu điều đó quan trọng, vì khác biệt năng lực giữa các thế hệ là rất lớn.
- Dùng nó cho câu hỏi nhanh, danh sách ngắn và việc lặp lại nơi tốc độ là quan trọng
- Chuyển sang mô hình mạnh hơn khi công việc cần suy luận kỹ hoặc lối viết trau chuốt
- Giữ prompt trực tiếp, mỗi lần một yêu cầu, và nói rõ định dạng đầu ra
- Chỉ chạy tại máy nếu bạn thật sự cần dùng ngoại tuyến hoặc riêng tư
- Kiểm tra mọi dữ kiện, ngày tháng hay con số cụ thể, như với bất kỳ mô hình nào
- Hỏi xem bạn đang dùng phiên bản nào, vì các thế hệ khác nhau khá nhiều
Câu hỏi thường gặp
Tôi có cần tải phần mềm về để dùng Llama không?
Không. Tải về và chạy tại máy là một lựa chọn, và nó là lựa chọn đúng nếu bạn cần dùng ngoại tuyến hoặc hoàn toàn riêng tư, nhưng nó đòi hỏi một máy tương đối mạnh và cho câu trả lời chậm hơn dịch vụ trực tuyến. Phần lớn mọi người dùng nó qua một nền tảng trên trình duyệt, nơi nó nằm cạnh các mô hình khác và không cần cài đặt gì cả.
Llama có nhanh hơn ChatGPT không?
Các mô hình Llama nhỏ nhanh hơn thấy rõ, điều đó khiến chúng rất hợp với câu hỏi ngắn, danh sách nhanh và mọi việc lặp đi lặp lại. Cái giá phải trả là năng lực: ở suy luận phức tạp và lối viết trau chuốt, các mô hình dẫn đầu rõ ràng tốt hơn. Cách hợp lý là dùng Llama để lấy tốc độ và đổi mô hình khi một câu hỏi hóa ra khó hơn vẻ ngoài của nó.
Llama có thật sự miễn phí không?
Trọng số của mô hình được tải về miễn phí và giấy phép cho phép hầu hết các mục đích sử dụng, kèm vài điều kiện chủ yếu liên quan tới việc triển khai thương mại ở quy mô rất lớn. Chạy nó thì không miễn phí trên thực tế, vì bạn tốn hoặc phần cứng và tiền điện của chính mình, hoặc phí trên mỗi token của một nhà cung cấp, khoản này đơn giản là thấp hơn nhiều so với giá của các mô hình dẫn đầu.
Chạy trên máy tính của tôi thì có riêng tư không?
Có, và đó là lý do mạnh nhất để chạy tại máy. Không gì bạn gõ ra rời khỏi máy, nó vẫn chạy khi ngắt internet, và không chính sách nhà cung cấp nào được áp dụng vì chẳng có nhà cung cấp nào tham gia. Cái giá là công sức cài đặt, một máy đủ bộ nhớ, tốc độ trả lời chậm nếu không có card đồ họa tốt, và bị giới hạn ở các mô hình nhỏ chạy được thoải mái.
Tôi nên dùng Llama thay cho ChatGPT hay Claude không?
Thay thế hẳn thì hiếm khi. Dùng song song thì thường xuyên. Nó là lựa chọn đúng cho các câu hỏi đơn giản cần nhanh, cho công việc lặp lại khối lượng lớn, và cho mọi thứ buộc phải chạy riêng tư hoặc ngoại tuyến. Với bài viết mà ai đó sẽ đọc kỹ, với suy luận nhiều bước khó, và với tài liệu cực dài, các mô hình dẫn đầu tốt hơn đáng kể. Có sẵn cả hai nghĩa là bạn chọn theo từng việc chứ không phải cam kết một lần cho mãi mãi.