AI dữ liệu thực tế là gì – và vì sao đây mới là bài kiểm tra khó
AI dữ liệu thực tế là việc xây dựng và triển khai các mô hình trí tuệ nhân tạo trên những tập dữ liệu thu thập ngoài phòng thí nghiệm, đầy nhiễu, thiếu chuẩn hóa và mang theo ràng buộc cụ thể của đời sống, nơi sai số có thể dẫn tới quyết định sai trong y tế, nông nghiệp hay quản lý tài nguyên. Đó chính là điểm mà các nhà nghiên cứu Việt Nam đang chạm tới: thay vì khoe mô hình đẹp trên bộ dữ liệu sạch, họ cố gắng làm cho AI hoạt động được với chuỗi số liệu biến động, ảnh X-quang mờ, hay câu chữ sinh viên viết vội. Khi AI được nhúng vào dòng dữ liệu như vậy, khoảng cách giữa công bố khoa học và hệ thống đang chạy ngoài thực địa hiện ra rất rõ – và khoảng cách đó phần lớn nằm ở dữ liệu, không phải ở thuật toán.

Từ mực nước sông Hồng đến mắt cá: khi dữ liệu không đi theo khuôn mẫu
Câu chuyện của PGS.TS. Phan Thị Thu Hồng cho thấy mặt trái của những đường cong độ chính xác tưởng như hoàn hảo. Trong dự báo mực nước sông Hồng, bà và cộng sự phải làm việc với số liệu quan trắc tại Vụ Quang, Hà Nội và Hưng Yên trong nhiều năm, rồi kết hợp ARIMA với các phương pháp học máy thống kê để dự báo mực nước. Một mô hình nắm phần tuyến tính, mô hình khác xử lý quan hệ phi tuyến – không công thức nào “ăn trọn” dữ liệu. Nhiều năm sau, bài toán cũ được đặt lại bằng các kiến trúc học sâu và cuối cùng là khung Transformer cho dự báo mực nước nhiều bước trên lưu vực sông Hồng. Dù vậy, các kết quả này vẫn là mô hình thử nghiệm, chưa thể gọi là hệ thống cảnh báo lũ đang vận hành thực tế. AI trong nghiên cứu ở đây mới chỉ là bản nháp cho AI vận hành ngoài đời.
Thách thức dữ liệu AI càng rõ khi nhóm của bà bước sang những bài toán gần bếp ăn và chợ cá. Trong nghiên cứu về đánh giá độ tươi qua mắt cá, team áp dụng năm kiến trúc thị giác hiện đại, kết hợp nhiều bộ phân loại và kỹ thuật lựa chọn đặc trưng; cấu hình tốt nhất chỉ đạt 85,99% độ chính xác trên bộ dữ liệu Freshness of the Fish Eyes. Câu số đẹp này không đồng nghĩa với một ứng dụng trên điện thoại có thể soi mọi mẻ cá ở cảng và đưa ra kết luận không sai. Hình ảnh ngoài chợ khác xa ảnh trong bộ dữ liệu: ánh sáng, góc chụp, loài cá, thậm chí cách người bán xếp cá lên khay. Điều tương tự lặp lại khi nhóm sinh viên do bà hướng dẫn nghiên cứu ảnh hưởng tiền xử lý ảnh X-quang DICOM đến phát hiện bất thường bằng AI: kết quả mới là thử nghiệm trên dữ liệu ảnh y tế, chưa phải một hệ thống được bệnh viện dùng để chẩn đoán. Trong những “ứng dụng AI Việt Nam” kiểu này, mô hình chỉ là phần nổi; phần chìm là cách thu thập dữ liệu, kiểm chứng và đưa nó vào quy trình chuyên môn.
AI tiếng Việt: khi câu chữ ngoài đời không “ngoan” như trong tập huấn luyện
Nếu bên thủy văn và nông nghiệp cho thấy dữ liệu vật lý nhiễu thế nào, hướng AI tiếng Việt của PGS.TS. Nguyễn Lưu Thùy Ngân phơi bày sự khó chịu của ngôn ngữ tự nhiên. Bà cùng nhóm tại UIT nhận ra một điều đơn giản nhưng hay bị bỏ qua: mô hình có thể nói tiếng Việt trôi chảy nhưng vẫn suy luận sai khi phải xác định một giả thuyết có thực sự suy ra từ tiền đề hay không. Vấn đề không chỉ là thuật toán, mà là thiếu dữ liệu kiểm tra những tình huống logic phức tạp, đặc biệt với tiếng Việt vốn ít tài nguyên hơn các ngôn ngữ lớn. Đó là lý do ViANLI ra đời: một bộ dữ liệu đối kháng hơn 10.000 cặp tiền đề – giả thuyết để buộc mô hình đụng vào những chỗ yếu về ngữ nghĩa và lập luận.
Kết quả thử nghiệm trên ViANLI là lời nhắc tỉnh táo cho bất kỳ ai đang hưng phấn vì chatbot nói tiếng Việt mượt mà: XLM-R Large chỉ đạt 45,5% độ chính xác, mô hình NLIMoE do nhóm đề xuất nhích lên 47,3% trên bộ dữ liệu này. Một câu phát biểu đáng trích là: "Trên ViANLI, XLM-R Large đạt độ chính xác 45,5%, trong khi mô hình NLIMoE đạt 47,3%". Những con số này không đại diện cho mức “thông minh tiếng Việt” tổng quát của AI, nhưng chúng cho thấy khi bị hỏi khó, hệ thống trả lời sai nhiều hơn chúng ta nghĩ. Điều đáng chú ý là khi thêm ViANLI vào dữ liệu huấn luyện, kết quả suy luận trên các bộ dữ liệu tiếng Việt khác như ViNLI, VLSP2021-NLI và VnNewsNLI đều được cải thiện. Nghĩa là, muốn AI tiếng Việt suy luận tốt hơn, ta không thể chỉ tăng kích thước mô hình; phải nuôi nó bằng những bộ dữ liệu sát với cách người Việt viết và nghĩ.

Từ mực nước, mắt cá đến phản hồi sinh viên: dữ liệu là trung tâm, không phải công nghệ
Khác với ViANLI thử trí AI bằng câu chữ đối kháng, công trình EduPulse lại đưa mô hình vào một loại dữ liệu AI tiếng Việt khác: phản hồi của sinh viên. Ở đây, nhóm của PGS.TS. Nguyễn Lưu Thùy Ngân xây dựng hệ thống phân tích phản hồi với bốn nhiệm vụ: phân loại cảm xúc, phân loại cảm xúc theo nhóm nội dung, phát hiện đề xuất và tóm tắt ý kiến. Dữ liệu là câu chữ quen thuộc trong môi trường đại học, đầy viết tắt, sai chính tả, ẩn dụ. Khi AI phân loại nhầm một góp ý tiêu cực thành trung tính, đó không còn là lỗi kỹ thuật thuần túy mà ảnh hưởng trực tiếp đến cách nhà trường lắng nghe người học. Chuỗi công việc từ ViANLI đến EduPulse cho thấy một trục nghiên cứu rõ ràng: muốn đánh giá và phát triển công nghệ cho tiếng Việt, phải có dữ liệu bám sát đặc điểm và bối cảnh sử dụng của ngôn ngữ đó.
Đặt cạnh các bài toán dự báo mực nước, đánh giá độ tươi cá hay tiền xử lý ảnh X-quang, một mẫu số chung hiện lên khá rõ: dữ liệu thực tế mới là rào cản chính khi triển khai AI trong y tế, nông nghiệp hay quản lý tài nguyên, chứ không phải thiếu mô hình mới. Với AI cho nông nghiệp, thủy văn hay chất lượng thực phẩm, “mô hình chỉ là một phần. Dữ liệu được thu thập thế nào, có đại diện cho hoàn cảnh sử dụng hay không, mục tiêu dự báo được xác định ra sao và kết quả được kiểm chứng bằng cách nào mới quyết định nghiên cứu có thể đi xa tới đâu”. Cả hai nhóm nghiên cứu đều nhấn mạnh sự khác biệt giữa AI trong bài báo và AI trong một hệ thống đang được bệnh viện hay cơ quan quản lý sử dụng. Khoảng cách ấy chỉ được thu hẹp khi chúng ta đầu tư cho dữ liệu, quy trình và việc kiểm chứng trên những kịch bản đời thường – điều khó hơn nhiều so với việc chọn thêm một kiến trúc học sâu mới.

Khoảng cách giữa phòng lab và đời sống: bài học cho tham vọng ứng dụng AI
Nhìn từ các dự án dự báo mực nước, đánh giá độ tươi cá, xử lý ảnh X-quang hay suy luận AI tiếng Việt, một kết luận không dễ nghe nhưng cần được nhắc lại: chúng ta đang nói về hai thế giới khác nhau khi nhắc đến AI trong nghiên cứu và AI trong các vấn đề xã hội thực tế. Ở thế giới thứ nhất, đường cong độ chính xác, cấu trúc mô hình mới và các bộ dữ liệu chuẩn hóa là thước đo. Ở thế giới thứ hai, điều quan trọng là mô hình có chịu được dữ liệu nhiễu, thiếu và lệch hay không; có khớp với quy trình công việc và trách nhiệm pháp lý của bác sĩ, kỹ sư thủy lợi, nhà quản lý giáo dục hay không. Các nhóm của PGS.TS. Phan Thị Thu Hồng và PGS.TS. Nguyễn Lưu Thùy Ngân đã chọn đi vào vùng giao nhau giữa hai thế giới ấy, nơi AI phải đối mặt với dữ liệu thật, yêu cầu thật và giới hạn thật.
Bài học quan trọng cho tham vọng “ứng dụng AI Việt Nam” là: đừng bắt đầu từ câu hỏi nên dùng mô hình nào, mà hãy khởi động từ câu hỏi có dữ liệu gì, được thu thập như thế nào, và ai chịu trách nhiệm về kết quả. Thách thức dữ liệu AI – từ chuỗi mực nước biến động, ảnh X-quang DICOM nhạy cảm cho đến câu phản hồi sinh viên viết vội – đang quyết định các dự án có dừng ở mức bài báo hay bước được ra ngoài hiện trường. Nếu tiếp tục coi AI là câu chuyện công nghệ thuần túy, chúng ta sẽ có thêm nhiều mô hình đẹp trên giấy, nhưng ít hệ thống đủ tin cậy để được người dùng trong đời sống thực chấp nhận.






