Nhóm học sinh Thủ đô ứng dụng AI để số hóa chữ Thái cổ

Năm học sinh Trường THPT Chuyên Chu Văn An (Hà Nội), phát triển nền tảng VietTrans, ứng dụng trí tuệ nhân tạo để hỗ trợ số hóa chữ Thái cổ.

Các thành viên tham gia buổi học tiếng Thái của học sinh trường Nậm Păm và hướng dẫn sử dụng phần mềm. Ảnh: Việt Hà.

Các thành viên tham gia buổi học tiếng Thái của học sinh trường Nậm Păm và hướng dẫn sử dụng phần mềm. Ảnh: Việt Hà.

Xây dựng dữ liệu, phát triển công cụ dịch và nhận dạng chữ

Từ nhu cầu số hóa tài liệu và hỗ trợ sử dụng tiếng Thái Đen trên Internet, nhóm học sinh lớp 11 Tin K118, Trường THPT chuyên Chu Văn An gồm: Ngô Hoàng Long, Phạm Mạnh Phong, Nguyễn Trí Minh, Lê Minh Sơn và Trần Gia Bảo, đã xây dựng dự án VietTrans.

Nhóm tập trung phát triển dữ liệu và các công cụ giúp người dùng đọc, viết, tra cứu, dịch tiếng Thái Đen và nhận dạng chữ Thái cổ.

Theo nhóm nghiên cứu, khó khăn đầu tiên là nguồn dữ liệu số phục vụ huấn luyện trí tuệ nhân tạo còn hạn chế. Nhiều tài liệu được lưu giữ dưới dạng sách giấy, bản chép tay hoặc nằm rải rác trong các gia đình, bản làng và công trình nghiên cứu. Việc tập hợp, chuyển đổi những tư liệu này thành dữ liệu có thể xử lý bằng máy tính đòi hỏi nhiều công đoạn.

Nhóm đã thu thập, số hóa và chuẩn hóa ngữ liệu từ nhiều nguồn. Với những văn bản sử dụng phông chữ cũ, các thành viên phải chuyển đổi sang chuẩn Unicode, kiểm tra lỗi ký tự và làm sạch dữ liệu. Các cặp câu tiếng Thái Đen và tiếng Việt được đối chiếu, căn chỉnh để phục vụ huấn luyện mô hình dịch máy.

Có những tài liệu cần kiểm tra thủ công từng ký tự trước khi đưa vào sử dụng. Công việc này mất nhiều thời gian nhưng là bước cần thiết để hạn chế sai sót trong dữ liệu đầu vào.

Khảo sát số hóa văn bản cổ tại Bảo Tàng Sơn La. Ảnh: Việt Hà.

Cùng với bộ ngữ liệu, nhóm phát triển công cụ chuyển đổi phông chữ, bộ gõ tiếng Thái, từ điển trực tuyến và nền tảng đóng góp dữ liệu cộng đồng. Các công cụ vừa phục vụ nghiên cứu, vừa hỗ trợ người dùng viết, tra cứu và bổ sung nội dung bằng tiếng Thái trên môi trường số.

Trên cơ sở dữ liệu đã xây dựng, nhóm tinh chỉnh mô hình dịch máy đa ngôn ngữ NLLB của Meta để hỗ trợ chuyển đổi giữa tiếng Thái Đen và tiếng Việt. Mô hình sử dụng kiến trúc Transformer, một kiến trúc được ứng dụng phổ biến trong lĩnh vực xử lý ngôn ngữ tự nhiên.

Theo nhóm, thách thức là giúp mô hình học từ nguồn ngữ liệu còn ít. Các thành viên phải thực hiện nhiều lần huấn luyện, điều chỉnh tham số và đánh giá kết quả dịch để tiếp tục hoàn thiện hệ thống.

Nguồn lực tính toán cũng là một trở ngại. Quá trình huấn luyện cần sử dụng bộ xử lý đồ họa (GPU), trong khi chi phí thuê máy chủ hoặc đầu tư thiết bị vượt quá khả năng tự đáp ứng của nhóm học sinh. Nhóm phải tận dụng các nguồn tài nguyên có thể tiếp cận, tối ưu dữ liệu và điều chỉnh quy trình để giảm thời gian, chi phí tính toán.

Có những lần quá trình huấn luyện kéo dài hàng chục giờ nhưng gặp lỗi, buộc nhóm phải thực hiện lại hoặc thay đổi cách xử lý. Qua các lần thử nghiệm, các thành viên từng bước điều chỉnh mô hình cho phù hợp với dữ liệu và điều kiện thiết bị.

Một phần việc khác của dự án là phát triển hệ thống nhận dạng ký tự quang học (OCR) cho chữ Thái cổ. Công cụ này sử dụng mô hình học sâu để nhận dạng chữ từ hình ảnh, chuyển tài liệu giấy thành văn bản số có thể lưu trữ, tìm kiếm, chỉnh sửa và tiếp tục xử lý bằng máy tính.

Các công cụ được tích hợp trên nền tảng trực tuyến VietTrans tại địa chỉ viettrans.info. Theo giới thiệu của nhóm, người dùng có thể trải nghiệm chức năng nhận dạng chữ Thái cổ từ ảnh, chuyển đổi văn bản, tra cứu dữ liệu ngôn ngữ và hỗ trợ dịch giữa tiếng Thái Đen với tiếng Việt.

Hướng tới hỗ trợ học tập và sử dụng ngôn ngữ trong đời sống

Nhóm học sinh xác định mục tiêu của VietTrans là tạo thêm điều kiện để tiếng Thái Đen và chữ Thái được sử dụng trong học tập, giao tiếp và các hoạt động hằng ngày. Vì vậy, việc số hóa tư liệu được triển khai cùng với phát triển những công cụ phục vụ người dùng.

Trong giáo dục, nhóm hướng tới hỗ trợ giáo viên xây dựng tài liệu song ngữ, giúp học sinh tra cứu từ vựng, học chữ và tiếp cận học liệu số. Với hoạt động nghiên cứu, công cụ nhận dạng chữ và tìm kiếm văn bản được kỳ vọng sẽ giúp việc khai thác tư liệu thuận tiện hơn.

Cô Lò Mai Cương, người biên soạn sách học chữ Thái cho Bộ GD&ĐT đánh giá dự án là một ý tưởng thiết thực. Theo cô, nếu được triển khai thành công, hệ thống có thể hỗ trợ đồng bào dân tộc Thái, các nhà nghiên cứu, sinh viên và những người muốn tìm hiểu chữ Thái.

Trò chuyện cùng cô Lò Mai Cương, chuyên gia biên soạn sách dạy tiếng Thái. Ảnh: Việt Hà.

Trò chuyện cùng cô Lò Mai Cương, chuyên gia biên soạn sách dạy tiếng Thái. Ảnh: Việt Hà.

Cô Cương cho biết, hiện nay, để đọc sách và nghiên cứu một số tài liệu chữ Thái, nhiều người vẫn phải tìm đến các nghệ nhân để học hỏi. Một hệ thống hỗ trợ đọc, tra cứu và xử lý văn bản sẽ giúp quá trình tiếp cận những tư liệu này thuận lợi hơn.

Về hướng ứng dụng, nhóm dự kiến tiếp tục hoàn thiện công cụ để hỗ trợ xây dựng nội dung song ngữ trong truyền thông, du lịch và phổ biến thông tin tại các địa phương có đông đồng bào dân tộc Thái. Những ứng dụng như dịch tài liệu hướng dẫn, thông báo cộng đồng hay thông tin về thủ tục hành chính là mục tiêu phát triển trong tương lai.

Bên cạnh xử lý văn bản, nhóm đang nghiên cứu mở rộng sang nhận dạng và tổng hợp tiếng nói. Hai công nghệ này lần lượt cho phép chuyển lời nói thành văn bản và chuyển văn bản thành âm thanh.

Theo nhóm, khó khăn của giai đoạn tiếp theo là xây dựng dữ liệu giọng nói. Công việc đòi hỏi thu âm từ nhiều người, với sự khác biệt về độ tuổi, giới tính và khu vực sinh sống; đồng thời kiểm tra chất lượng âm thanh, lập bản chép lời và xử lý khác biệt trong cách phát âm.

Nếu phát triển được các chức năng này, người dùng có thể nhập văn bản bằng giọng nói, nghe đọc tài liệu hoặc học phát âm tiếng Thái Đen. Đây cũng là hướng tiếp cận mà nhóm mong muốn dành cho người cao tuổi và những người chưa quen sử dụng bàn phím.

Về lâu dài, VietTrans được định hướng kết nối dữ liệu, dịch máy, nhận dạng chữ, từ điển, bộ gõ và công nghệ giọng nói. Nhóm cũng dự kiến phát triển giao diện lập trình ứng dụng (API), cho phép các phần mềm khác tích hợp những công cụ xử lý tiếng Thái Đen.

Từ nền tảng hiện có, nhóm học sinh sẽ tiếp tục bổ sung dữ liệu, đánh giá chất lượng dịch và nhận dạng chữ, đồng thời hoàn thiện các chức năng phục vụ người dùng. Mục tiêu nhóm đặt ra là giúp việc học, tra cứu và sử dụng tiếng Thái Đen trên môi trường số trở nên thuận tiện hơn.

Thanh Sơn

Nguồn GD&TĐ: https://giaoducthoidai.vn/nhom-hoc-sinh-thu-do-ung-dung-ai-de-so-hoa-chu-thai-co-post795293.html