AI đa phương thức: cách làm việc với văn bản, hình ảnh và tài liệu

Học các quy trình AI đa phương thức thực tế cho văn bản, hình ảnh, ảnh chụp màn hình, tệp PDF, tài liệu dài và các nhiệm vụ trích xuất có cấu trúc.

Đa phương thức nghĩa là gì

AI đa phương thức nghĩa là một hệ thống AI có thể làm việc với nhiều hơn một loại đầu vào hoặc đầu ra. Trong công việc hằng ngày, điều đó thường có nghĩa là văn bản cộng với hình ảnh, ảnh chụp màn hình, tệp PDF, biểu đồ, bảng biểu, tài liệu hoặc bộ trình chiếu. Thay vì chỉ gõ một câu hỏi, bạn có thể đưa cho mô hình bối cảnh dạng hình ảnh hoặc tài liệu và yêu cầu nó trích xuất, giải thích, so sánh, tóm tắt hoặc biến đổi những gì nó thấy.

Câu hỏi hữu ích không phải là "AI đa phương thức là gì?". Mà là "phần nào trong công việc của tôi cần bằng chứng từ văn bản, hình ảnh và tài liệu cùng một lúc?". Đó là lúc nó thôi làm một màn trình diễn và bắt đầu giúp bạn tiết kiệm cả một buổi chiều.

Một quản lý sản phẩm tải lên ảnh chụp màn hình và hỏi về các vấn đề trải nghiệm người dùng. Một nhà sáng lập tải lên ba trang giá của đối thủ và yêu cầu một bảng so sánh. Một nhà nghiên cứu tải lên một tệp PDF và hỏi về các luận điểm, các dè dặt và những kết luận có nguồn. Một nhóm hỗ trợ dán một khiếu nại của khách hàng kèm ảnh chụp màn hình và hỏi chẩn đoán.

Một quy trình đa phương thức tốt có bốn nước đi: quan sát, trích xuất, diễn giải và kiểm chứng. Quan sát là yêu cầu mô hình mô tả những gì nhìn thấy hoặc có mặt. Trích xuất biến đầu vào thành các trường có cấu trúc. Diễn giải giải thích bằng chứng đó có thể mang ý nghĩa gì. Kiểm chứng xem câu trả lời có bám vào nguồn hay không. Phần lớn các prompt đa phương thức yếu đều nhảy thẳng tới diễn giải, và đó chính là chỗ những lỗi sai đầy tự tin lẻn vào.

Quy tắc thực tế: hãy bắt mô hình chứng minh rằng nó đã nhìn thấy nguồn, trước khi yêu cầu nó suy luận về nguồn. Với hình ảnh, hãy đòi bằng chứng nhìn thấy được. Với tệp PDF, hãy đòi một sơ đồ tài liệu. Với một tập tài liệu dài, hãy đòi các phần, các luận điểm, các bảng và những chỗ chưa rõ trước khi có bản tóm tắt cuối cùng. Điều này biến AI đa phương thức từ một thứ mới lạ thành một hệ thống làm việc lặp lại được.

Quy trình từ hình ảnh sang văn bản

Các mô hình AI nhận đầu vào hình ảnh rất hữu ích với ảnh chụp màn hình, biểu đồ, bảng trắng, ảnh sản phẩm, hóa đơn, ghi chú viết tay, quảng cáo mạng xã hội, bảng điều khiển, sơ đồ và kiểm thử giao diện. Điểm mấu chốt là hãy coi việc phân tích hình ảnh là thu thập bằng chứng trước khi đưa ra ý kiến. Hãy hỏi mô hình nó nhìn thấy gì, nó không đọc được gì, và nó đang suy đoán điều gì.

Hãy dùng quy trình hình ảnh sau khi độ chính xác quan trọng: tải ảnh lên, yêu cầu một bản kiểm kê bằng chứng nhìn thấy được, trích xuất các chi tiết có cấu trúc, yêu cầu phần diễn giải riêng, rồi chạy một vòng kiểm chứng. Nếu ảnh có chữ quá nhỏ, mép bị cắt, vùng mờ hoặc chỗ mơ hồ, hãy dặn mô hình đánh dấu những giới hạn đó thay vì tự lấp chỗ trống.

Prompt phân tích ảnh chụp màn hình: "Hãy phân tích ảnh chụp màn hình này thành bốn phần. Thứ nhất, chỉ liệt kê các thành phần nhìn thấy được: tiêu đề, nút bấm, lỗi, nhãn, con số và các vấn đề bố cục. Thứ hai, trích mọi đoạn chữ đọc được vào một bảng kèm vị trí và mức độ chắc chắn. Thứ ba, giải thích những vấn đề mà người dùng có thể gặp, chỉ dựa trên bằng chứng nhìn thấy được. Thứ tư, liệt kê những chỗ quá nhỏ, bị cắt hoặc không đủ rõ để xác minh."

Prompt trích xuất biểu đồ: "Hãy xem biểu đồ này. Trích ra tiêu đề, các trục, nhãn, chú giải, khoảng thời gian, giá trị cao nhất và thấp nhất, các xu hướng nhìn thấy được và mọi lưu ý. Tách phần dữ liệu nhìn thấy trực tiếp khỏi phần diễn giải. Nếu không đọc được giá trị chính xác, hãy nói là ước chừng và giải thích vì sao."

Prompt rà soát trải nghiệm người dùng: "Hãy nhìn màn hình sản phẩm này với vai trò người rà soát khả dụng. Bắt đầu bằng các quan sát nhìn thấy được. Sau đó chỉ ra các điểm gây vướng, các lo ngại về khả năng tiếp cận, các nhãn gây khó hiểu, các trạng thái còn thiếu và những hành động tiếp theo có khả năng xảy ra. Trả về một bảng xếp theo mức ưu tiên gồm vấn đề, bằng chứng, tác động, đề xuất khắc phục và mức độ chắc chắn."

Prompt đa phương thức tốt lên khi định dạng đầu ra được nói rõ. Một prompt mơ hồ kiểu "Bạn thấy cái này thế nào?" chỉ mời gọi một câu trả lời mơ hồ. Một prompt tốt hơn sẽ yêu cầu một bảng, một danh sách kiểm tra, một tập các rủi ro, hoặc một bản viết lại kèm đối chiếu trước và sau. Khi bạn cần một sản phẩm công việc, hãy nói rõ sản phẩm đó là gì.

Quy trình với tài liệu và tệp PDF

Tài liệu đặt ra một thử thách khác. Tệp PDF và các tệp dài có thể chứa văn bản, bố cục trang, bảng biểu, chú thích, biểu đồ, phụ lục, trang quét và cả những chỗ mâu thuẫn nhau. Một AI có thể phân tích tài liệu không tự động khiến mọi bản tóm tắt trở nên đáng tin. Bạn vẫn cần một quy trình giữ cho câu trả lời bám vào nguồn.

Hãy bắt đầu bằng một sơ đồ tài liệu. Yêu cầu mô hình xác định tiêu đề, ngày tháng, tác giả hoặc tổ chức nếu nhìn thấy được, các phần, khoảng trang, bảng, hình, phụ lục và những vùng khó đọc. Đừng vội hỏi câu trả lời cuối cùng. Sơ đồ tài liệu cho bạn biết mô hình có nhìn thấy những phần quan trọng hay không.

Prompt lập sơ đồ tài liệu: "Trước khi tóm tắt, hãy lập một sơ đồ tài liệu. Gồm tiêu đề, ngày tháng, tác giả hoặc tổ chức nhìn thấy được, các phần chính, khoảng trang nếu có, bảng, hình, phụ lục, các thuật ngữ lặp lại, và mọi vùng có vẻ không đọc được. Đừng suy đoán những chi tiết còn thiếu. Hãy ghi Không nhìn thấy khi cần."

Prompt trích xuất từ PDF: "Hãy trích thông tin có cấu trúc từ tài liệu này vào một bảng với các cột: luận điểm, con số hoặc chỉ số, ngày hoặc kỳ, chủ thể, trang hoặc phần nguồn, mức độ chắc chắn, và ghi chú kiểm chứng. Chỉ đưa vào những dữ kiện được tài liệu chống lưng. Nếu thiếu một trường, hãy ghi Không tìm thấy."

Prompt tổng hợp ngữ cảnh dài: "Hãy dùng tập tài liệu này để trả lời câu hỏi sau: [câu hỏi]. Trước hết liệt kê các nguồn hoặc phần liên quan. Sau đó tóm tắt bằng chứng. Rồi chỉ ra các mâu thuẫn, các lưu ý và các câu hỏi còn bỏ ngỏ. Kết thúc bằng một bản ghi nhớ quyết định dạng gạch đầu dòng. Đừng dùng kiến thức bên ngoài trừ khi tôi yêu cầu."

AI ngữ cảnh dài cho tài liệu rất mạnh khi mô hình có thể giữ một khối lượng lớn tài liệu liên quan sẵn sàng cùng lúc. Tài liệu của Gemini nhấn mạnh các trường hợp dùng ngữ cảnh dài, còn Anthropic ghi rõ khả năng hỗ trợ PDF cho cả nội dung chữ và hình, kèm các giới hạn thực tế. Điều rút ra không phải là một mô hình luôn thắng. Điều rút ra là các nhiệm vụ tài liệu nên được thử bằng chính tài liệu bạn dùng.

Các mẫu prompt

Prompt đa phương thức tốt được xây như một quy trình vận hành nhỏ. Nó xác định đầu vào, vai trò, quy tắc về bằng chứng, định dạng đầu ra và bước kiểm chứng. Điều này đặc biệt quan trọng khi prompt kết hợp cả hình ảnh và văn bản, vì mô hình có thể trộn lẫn thứ nó nhìn thấy với thứ nó phỏng đoán.

Hãy dùng khuôn prompt đa phương thức dùng chung này: "Bạn đang hỗ trợ tôi làm [nhiệm vụ]. Chỉ dùng hình ảnh hoặc tài liệu đính kèm và bối cảnh bên dưới. Trước hết liệt kê bằng chứng quan sát được. Sau đó trích các trường được yêu cầu. Rồi đưa ra phân tích. Đánh dấu rõ những chỗ chưa chắc chắn. Trả về câu trả lời cuối ở dạng [bảng/danh sách kiểm tra/bản ghi nhớ/các trường kiểu JSON]. Bối cảnh: [bối cảnh]. Các trường hoặc câu hỏi: [các trường]."

Khuôn trích xuất có cấu trúc: "Hãy trích các trường sau: [danh sách trường]. Với mỗi trường, ghi kèm giá trị, bằng chứng nguồn, mức độ chắc chắn và ghi chú kiểm chứng. Nếu nguồn không chứa câu trả lời, hãy ghi Không tìm thấy. Đừng đoán." Khuôn này dùng được cho hóa đơn, trang web đối thủ, biểu đồ, tệp PDF, biểu mẫu tiếp nhận, ảnh chụp màn hình từ bộ phận hỗ trợ và ghi chú nghiên cứu.

Khuôn kết hợp hình ảnh và tài liệu: "Hãy so sánh ảnh chụp màn hình này với tài liệu đính kèm. Chỉ ra chỗ ảnh khớp với quy trình đã ghi trong tài liệu, chỗ nào khác biệt, và người dùng nên làm gì tiếp theo. Dùng một bảng với các cột: mục quan sát được, tham chiếu trong tài liệu, tình trạng khớp, rủi ro và hành động đề xuất."

Khuôn kiểm tra chất lượng: "Hãy soi lại câu trả lời trước của bạn dựa trên nguồn. Tìm các khẳng định không có căn cứ, các lưu ý còn thiếu, các vùng không đọc được, các con số sai và các giả định. Trả về một phiên bản đã sửa cùng một danh sách ngắn những gì đã thay đổi." Prompt này nhạt nhẽo theo cách tốt nhất. Nó bắt lỗi trước khi lỗi trở thành chuyện xấu hổ.

Với công việc lặp lại, hãy lưu các prompt thành quy trình chứ không phải câu hỏi dùng một lần. Một bộ prompt tái sử dụng có thể gồm: phân loại nhanh ảnh chụp màn hình, trích xuất biểu đồ, lập sơ đồ PDF, bảng bằng chứng, bản ghi nhớ quyết định và vòng kiểm chứng. Mục tiêu không phải là trở thành nghệ sĩ viết prompt. Mục tiêu là làm cho công việc đáng tin dễ lặp lại hơn.

Chọn mô hình nào cho việc đa phương thức

Mô hình tốt nhất cho AI đa phương thức phụ thuộc vào đầu vào và đầu ra. Hãy nghĩ tới Gemini khi nhiệm vụ liên quan tới ngữ cảnh dài, các tập tài liệu lớn hoặc rà soát nguồn đa phương thức. Hãy nghĩ tới Claude khi cần đọc cẩn thận, phân tích hình ảnh, quy trình với PDF và suy luận có cấu trúc trên tài liệu nguồn. Hãy nghĩ tới các mô hình của OpenAI cho quy trình làm việc rộng, các nhiệm vụ kết hợp ảnh và chữ, soạn thảo, lập trình, đầu ra có cấu trúc và việc biến phân tích thành sản phẩm hoàn chỉnh.

Nhiệm vụBắt đầu vớiCần kiểm tra gì
Tập PDF lớnGemini hoặc ClaudeĐộ bao phủ, bám vào trang và phần, lưu ý bị bỏ sót
Rà soát ảnh chụp màn hình hoặc giao diệnClaude hoặc OpenAIBằng chứng nhìn thấy, vấn đề tiếp cận, cách sửa khả thi
Phân tích biểu đồ hoặc bảng điều khiểnGemini, Claude hoặc OpenAIĐộ chính xác số liệu, nhãn, mức chắc chắn ở giá trị khó đọc
Hình ảnh kèm hướng dẫn viếtOpenAI, Claude hoặc GeminiMô hình có tuân cả ràng buộc hình lẫn chữ không
Bản ghi nhớ hoặc tóm tắt gửi khách hàngOpenAI hoặc ClaudeCấu trúc, giọng văn, khả năng truy nguồn, mức phải dọn dẹp

Nếu bạn đang so sánh Gemini vs ChatGPT, hãy bắt đầu bằng cùng một prompt về ảnh hoặc PDF ở cả hai rồi chấm điểm từng kết quả. Nếu công việc của bạn chủ yếu là rà soát PDF, hãy dùng quy trình chi tiết hơn trong bài tóm tắt PDF bằng AI. Người thắng phải là mô hình cho ra kết quả chính xác nhất, dùng được nhất và kiểm chứng được nhất với chính tài liệu nguồn của bạn.

Whizi làm việc này dễ hơn vì bạn có thể thử các mô hình ở cùng một chỗ thay vì duy trì một quy trình riêng cho từng trợ lý. Hãy chọn một việc thật trong tuần của bạn: một ảnh chụp màn hình, một tệp PDF, một tài liệu khách hàng, một ảnh sản phẩm hoặc một trang của đối thủ. Chạy cùng một prompt trên nhiều mô hình, so sánh bằng chứng, và lưu lại cặp mô hình cộng prompt nào hoạt động tốt nhất.

Khi bạn đã sẵn sàng dựng một quy trình lặp lại được, hãy tạo tài khoản tại trang đăng ký Whizi. Nếu bạn đang cân nhắc xem một không gian làm việc gộp chung có hợp với nhóm mình không, hãy so sánh các lựa chọn tại bảng giá Whizi.

Danh sách kiểm tra
  • Đòi bằng chứng quan sát được trước khi cho phép diễn giải.
  • Dùng các trường có cấu trúc khi trích xuất từ hình ảnh, biểu đồ, PDF hoặc ảnh chụp màn hình.
  • Dặn mô hình đánh dấu những chỗ không đọc được, bị cắt, mờ hoặc còn thiếu.
  • Tách prompt trích xuất khỏi prompt phân tích để tăng độ chính xác.
  • Chạy một vòng kiểm chứng trước khi tin vào các con số, luận điểm, ngày tháng hay khuyến nghị.
  • So sánh cùng một prompt đa phương thức trên nhiều mô hình trước khi lưu thành quy trình.
  • Dùng Whizi để giữ việc chọn mô hình luôn linh hoạt thay vì chốt mãi một mô hình.

Câu hỏi thường gặp

Ví dụ về AI đa phương thức là gì?

Một ví dụ phổ biến là tải lên một ảnh chụp màn hình hoặc tệp PDF rồi yêu cầu AI trích các chi tiết nhìn thấy được, tóm tắt nội dung, chỉ ra vấn đề và trả về một bảng hoặc bản ghi nhớ có cấu trúc.

AI đa phương thức đọc hình ảnh có chính xác không?

Nó có thể hữu ích, nhưng độ chính xác phụ thuộc vào chất lượng ảnh, chữ có đọc được không, ảnh có bị cắt không, độ phân giải và độ phức tạp của nhiệm vụ. Hãy yêu cầu mô hình tách bằng chứng nhìn thấy khỏi phần diễn giải và đánh dấu mọi chỗ chưa rõ.

Mô hình AI nào tốt nhất cho việc đa phương thức?

Không có người thắng vĩnh viễn. Gemini, Claude và các mô hình của OpenAI đều có thể hữu ích, tùy vào việc nhiệm vụ liên quan tới tài liệu dài, hình ảnh, tệp PDF, trích xuất có cấu trúc hay văn bản trau chuốt. Hãy thử cùng một prompt trên nhiều mô hình.