Multimodal models là các mô hình AI có thể xử lý và kết hợp nhiều loại dữ liệu khác nhau, thay vì chỉ làm việc với một loại dữ liệu duy nhất.
Ví dụ các “modalities” phổ biến gồm:
- Text
- Image
- Audio
- Video
- Structured data
Một mô hình chỉ xử lý văn bản là unimodal.
Ví dụ, bạn tải lên một biểu đồ và hỏi: “Hãy giải thích xu hướng trong biểu đồ này.” Mô hình phải cùng lúc nhìn hình ảnh, đọc chữ/số, hiểu câu hỏi và tạo câu trả lời. Đó chính là multimodal AI.
Tương tự một multimodal model có thể:
- đọc một bảng số liệu và giải thích;
- nhìn ảnh X-quang và mô tả đặc điểm;
- nghe một đoạn ghi âm và tóm tắt;
- xem video và nhận diện sự kiện;
- kết hợp hình ảnh với câu hỏi bằng ngôn ngữ tự nhiên.
Trong tiến trình AI hiện nay, có thể hình dung traditional LLM chủ yếu hiểu và sinh text, còn multimodal model có thể hiểu text, image, audio, video và các loại dữ liệu khác. Điểm quan trọng là multimodal không chỉ có nghĩa là nhận nhiều loại input. Mô hình còn phải biết kết nối thông tin giữa các loại dữ liệu.
Tài liệu tham khảo và đọc thêm:
- https://www.ibm.com/think/topics/multimodal-llm
- https://encord.com/blog/top-multimodal-models/
- https://huyenchip.com/2023/10/10/multimodal.html



Không có nhận xét nào:
Đăng nhận xét