Bắt đầu từ một bài toán rất “con người” – làm thế nào để AI hiểu được cảm xúc ẩn sau lời nói, nhóm sinh viên Trường Đại học FPT đã cùng các nhà nghiên cứu trong và ngoài nước phát triển mô hình DiGemo vượt qua nhiều vòng thử nghiệm và phản biện, được chấp nhận đăng trên tạp chí Information Sciences (Elsevier, Q1). Đằng sau cột mốc học thuật ấy là hành trình của những sinh viên dám thử sức với những bài toán tưởng chừng vượt quá khả năng của mình.
Sinh viên AI thực hiện nghiên cứu quốc tế cùng sự đồng hành của PGS. TS. Đặng Ngọc Minh Đức.
Khi AI không chỉ cần hiểu lời nói, mà còn phải hiểu cảm xúc
Từ những kết nối học thuật của PGS. TS. Đặng Ngọc Minh Đức, nhóm sinh viên chuyên ngành Trí tuệ nhân tạo, Trường Đại học FPT gồm Trang Hoàng Khang, Nguyễn Quốc Bảo, Nguyễn Minh Nhựt và Đinh Viết Vĩnh Khánh có cơ hội cùng nghiên cứu với các cộng sự đến từ Đại học Sungkyunkwan, Đại học Kyung Hee (Hàn Quốc) và Trường Đại học Quốc tế – Đại học Quốc gia TP. Hồ Chí Minh. Công trình được thực hiện với sự đồng hành của AI Technology and Application Research Lab (AiTA Lab) – Trường Đại học FPT, trong đó PGS. TS. Đặng Ngọc Minh Đức giữ vai trò định hướng và quản lý nghiên cứu, cùng các thành viên trao đổi, kiểm chứng và hoàn thiện công trình.
Thay vì chỉ dựa vào nội dung của từng câu nói, nhóm tập trung giải quyết một bài toán khó hơn: Làm thế nào để AI có thể nhận diện cảm xúc trong một cuộc hội thoại khi cảm xúc được thể hiện đồng thời qua nhiều phương thức như văn bản, giọng nói và hình ảnh, đồng thời chịu ảnh hưởng bởi ngữ cảnh của toàn bộ cuộc hội thoại. Đây cũng là lý do nhóm lựa chọn bài toán Multimodal Emotion Recognition in Conversation (ERC) – một hướng nghiên cứu đặt con người và những sắc thái trong giao tiếp làm trung tâm.
Với nhóm, một câu nói như “Ừ, được thôi” là ví dụ rất rõ cho khoảng cách giữa những gì được nói ra và cảm xúc thực sự được truyền tải. Cùng một câu chữ có thể thể hiện sự đồng tình, bình thản hoặc khó chịu, tùy vào hoàn cảnh, giọng điệu và biểu cảm của người nói. Để AI hiểu được những khác biệt ấy, nhóm phải tìm cách để các nguồn thông tin khác nhau không chỉ được đưa vào mô hình, mà còn có thể bổ trợ và làm rõ lẫn nhau.
Theo nhóm nghiên cứu, ERC đòi hỏi AI không chỉ hiểu câu chữ mà còn phải nhận diện ngữ cảnh, giọng nói và biểu cảm để nắm bắt đúng cảm xúc trong hội thoại. “Nhóm hướng tới bài toán nghiên cứu là lấy con người làm trung tâm và cảm xúc là thứ rất ‘con người’”, nhóm chia sẻ. Từ đó, nhóm phát triển DiGemo – mô hình học đa đồ thị kết hợp self-distillation, giúp khai thác và cân bằng thông tin từ nhiều phương thức. Đáng chú ý, hướng đi này bắt đầu từ một thử nghiệm chưa đạt kỳ vọng: khi đưa văn bản, giọng nói và hình ảnh vào cùng một đồ thị, mô hình quá phụ thuộc vào văn bản, khiến tín hiệu âm thanh và hình ảnh bị lu mờ.
Thay vì xem đó là thất bại, nhóm dùng chính kết quả này để đặt lại cách tiếp cận, chuyển sang mô hình đa đồ thị kết hợp cơ chế hợp nhất thích ứng và self-distillation. “Chính từ kết quả ‘không như kỳ vọng’ ban đầu đó lại trở thành hướng đi cốt lõi của cả bài”, nhóm chia sẻ. Điều đáng nể trong hành trình ấy không phải là nhóm luôn tìm được đáp án đúng ngay từ đầu, mà là biết đọc một kết quả chưa tốt, tìm ra vấn đề và biến nó thành bước tiến của nghiên cứu.
Không chỉ có những dòng code và con số
Khung mô hình DiGemo giải quyết ba hạn chế trên bằng ba đóng góp chính:
- Mô hình hóa ngữ cảnh dựa trên Transformer kết hợp đa đồ thị dị chất: quan hệ nội phương thức được học độc lập, trong khi tương tác liên phương thức được biểu diễn qua ba đồ thị dị chất theo từng cặp, giúp giảm tính dị chất quan hệ.
- Cơ chế hợp nhất thích ứng theo Gated Multimodal Unit (GMU): tự động điều chỉnh trọng số đóng góp của từng phương thức trong quá trình hợp nhất đặc trưng.
- Chiến lược tự chưng cất (self-distillation): chính quy hóa biểu diễn đơn phương thức bằng cách chuyển giao tri thức từ biểu diễn đa phương thức đã hợp nhất, hạn chế thiên lệch phương thức.
Nhưng phía sau những con số ấy là một quá trình không hề thẳng tắp. Nhóm liên tục thử nghiệm, phân tích và tranh luận về từng lựa chọn: Vì sao phải làm như vậy? Điểm mới nằm ở đâu? Liệu cách tiếp cận này có thực sự tốt hơn? “Đây không phải là ‘cãi nhau’, mà là tranh luận học thuật để cùng đi đến một phương án tốt hơn”, nhóm chia sẻ.
Trong quá trình nghiên cứu, giảng viên và các chuyên gia giữ vai trò quan trọng ở góc độ phản biện học thuật: liên tục đặt câu hỏi, chất vấn những giả định, chỉ ra điểm chưa hợp lý và gợi mở những hướng thí nghiệm cần kiểm chứng. Những trao đổi này không chỉ giúp nhóm nhìn lại từng quyết định nghiên cứu mà còn rèn cách tiếp cận vấn đề dưới góc nhìn của một người phản biện, đặt câu hỏi về cơ sở của một kết luận, thay vì chỉ tìm cách chứng minh nó đúng.
“Không ai đủ giỏi ngay lúc bắt đầu cả”
Có lẽ điều đáng nhớ nhất sau công trình này không nằm ở một con số hay một dòng tên trên bài báo, mà ở những giới hạn mà chính các thành viên đã vượt qua. Từng nghĩ mình chưa thể viết một bài báo khoa học hoàn chỉnh bằng tiếng Anh, càng chưa nghĩ đến việc phải trình bày và bảo vệ công trình trước những reviewer quốc tế chuyên sâu. Quá trình nghiên cứu buộc bạn phải học cách trình bày ý tưởng chặt chẽ, lập luận có căn cứ và bảo vệ quan điểm bằng số liệu.
Nguyễn Minh Nhựt, Trang Hoàng Khang và Nguyễn Quốc Bảo – những gương mặt trẻ trong nhóm nghiên cứu AI.
“Cảm giác lớn nhất chắc là nhẹ nhõm. Sau khi kiên trì qua từng vòng phản biện, đến khi bài được nhận thì em cảm nhận rõ công sức bấy lâu đã có kết quả, đan xen với một chút niềm vui và tự hào”, nhóm chia sẻ. Với nhóm, đây là công trình Q1 đầu tiên và cũng là một minh chứng rằng sinh viên hoàn toàn có thể bước vào nghiên cứu quốc tế nếu có một quy trình nghiêm túc và đủ bền bỉ.
“Thật ra, không ai đủ giỏi ngay từ lúc bắt đầu cả. Mình giỏi lên trong quá trình làm, chứ không phải giỏi rồi mới được làm. Nếu cứ chờ đến khi thấy mình sẵn sàng thì sẽ chẳng bao giờ bắt đầu. Hãy chọn một hướng mình thấy thú vị, tìm một người thầy hoặc một nhóm tốt để đồng hành, và chấp nhận rằng ở giai đoạn đầu, mình có thể thấy bản thân còn kém, đó là chuyện bình thường. Hãy cứ cố gắng, đừng trì hoãn và bắt đầu từ những điều nhỏ nhất. Chính những điều nhỏ đó, nếu được thực hiện đều đặn mỗi ngày, sẽ giúp bạn tiến bộ và giỏi lên lúc nào không hay.” – Bộc bạch của những chàng trai IT sau quá trình nằm gai nếm mật để có công trình nghiên cứu khoa học được đăng trên tạp chí Q1.
Cơ duyên hợp tác đến từ các kết nối học thuật của PGS. TS. Đặng Ngọc Minh Đức, cùng các nghiên cứu sinh tại Hàn Quốc và PGS. TS. Võ Thị Lưu Phương. Trong công trình, nhóm sinh viên trực tiếp tham gia xây dựng ý tưởng, phát triển mô hình, lập trình, thực hiện thí nghiệm, phân tích kết quả và hoàn thiện bản thảo; các chuyên gia đảm nhận vai trò cố vấn, phản biện và kiểm soát chất lượng nghiên cứu.
Các thành viên triển khai nghiên cứu trong không gian AI Technology and Application Research Lab (AiTA Lab).
Với các sinh viên, đây cũng là một minh chứng cho giá trị của việc được tiếp cận nghiên cứu từ sớm. Theo nhóm, điều Trường Đại học FPT tạo ra rõ nhất là một môi trường cởi mở để sinh viên không chỉ dừng lại ở kiến thức trên lớp mà có thể bắt tay vào những bài toán thực tế. Tại AI Technology and Application Research Lab (AiTA Lab), sinh viên có cơ hội tham gia nghiên cứu ngay từ khi còn đi học, nhận hướng dẫn từ giảng viên và kết nối với mạng lưới các nhà nghiên cứu quốc tế. “Quan trọng nhất là tụi em được trao cơ hội làm việc thật trên một bài toán thật, cùng những người có kinh nghiệm, và chính điều đó giúp tụi em đi xa hơn so với những gì học được trên giảng đường.”
Toàn bộ quá trình triển khai ý tưởng, huấn luyện mô hình, đánh giá và hoàn thiện nghiên cứu diễn ra trong khoảng 4 tháng, từ tháng 9/2025 đến tháng 1/2026. Sau đó, nhóm tiếp tục trải qua khoảng 8 tháng của quá trình phản biện và hoàn thiện bài báo trước khi nhận được thông báo chấp nhận. Từ một câu hỏi về cách để AI hiểu tốt hơn những cảm xúc rất con người, nhóm đã đi qua hàng loạt thử nghiệm, những lần kết quả chưa như mong đợi, những cuộc tranh luận chuyên môn, một tuần chạy đua với deadline và nhiều vòng phản biện quốc tế.
Công trình “Towards effective multimodal emotion recognition in conversations via joint multi-graph learning and self-distillation” vì thế không chỉ là một công bố trên tạp chí Q1. Đó còn là câu chuyện về cách những sinh viên trẻ học cách đặt câu hỏi, chấp nhận kết quả chưa hoàn hảo, bảo vệ ý tưởng bằng bằng chứng và kiên trì đi tiếp. Và có lẽ, với một hành trình nghiên cứu, đó mới là thành quả đáng giá nhất: không phải chờ đến khi đủ giỏi mới bắt đầu, mà bắt đầu để từng ngày trở nên giỏi hơn.
Ảnh: Quý Lộc| Bài: Ái Nhi – Huỳnh Hà
