Giáo Dục Mở và Ứng dụng phát triển

https://giaoducmo.avnuc.vn


Chile ra mắt mô hình AI nguồn mở đầu tiên được thiết kế cho các nền văn hóa Mỹ Latinh

Chile ra mắt mô hình AI nguồn mở đầu tiên được thiết kế cho các nền văn hóa Mỹ Latinh

Chile launches the first open source AI model designed for Latin American cultures

by Sofia Linna, Published on: 01/10/2026

Theo: https://interoperable-europe.ec.europa.eu/collection/open-source-observatory-osor/news/chile-launches-open-source-ai-model-latam-gpt

Bài được đưa lên Internet ngày: 01/10/2026

Các mô hình AI đang thay đổi cách chúng ta sáng tạo, chia sẻ và gìn giữ văn hóa. Đồng thời, vấn đề thiếu sự đa dạng (hay tính đồng nhất) nảy sinh khi các mô hình chủ yếu được huấn luyện bằng dữ liệu tiếng Anh và đưa ra thông tin sai lệch về thực tế tại các khu vực khác nhau. Nếu được phát triển với tinh thần bao trùm và đa dạng, các mô hình ngôn ngữ lớn (LLM) có tiềm năng thực sự trong việc mở rộng khả năng tiếp cận, bảo tồn di sản, tăng cường sự hiện diện của các nền văn hóa đa dạng và khơi nguồn cho những hình thức sáng tạo mới. Đây chính là ý tưởng cốt lõi đằng sau Latam-GPT.

Latam-GPT là mô hình ngôn ngữ lớn (LLM) nguồn mở đầu tiên của Chile được huấn luyện dựa trên các nền văn hóa Mỹ Latinh. Mô hình AI này lần đầu tiên được công bố vào tháng 2 năm 2026 tại Hội nghị Thượng đỉnh Hành động về Trí tuệ Nhân tạo ở Paris, nhưng quá trình phát triển đã bắt đầu từ khoảng năm 2023, khi một nhóm nghiên cứu tại Trung tâm Quốc gia về Trí tuệ Nhân tạo (CENIA) của Chile bắt đầu tìm cách xây dựng một LLM dành riêng cho khu vực dựa trên các mô hình AI nguồn mở hiện có sẵn.

Ngay từ đầu, nhóm nghiên cứu tại CENIA đã mong muốn "học hỏi và xây dựng một nền tảng nguồn mở, chú trọng đặc biệt đến những khác biệt về ngôn ngữ văn hóa, cũng như lịch sử văn hóa và các quan điểm đa dạng trong khu vực Mỹ Latinh", bà Gabriela Arriagada Bruneau – nhà nghiên cứu liên kết tại CENIA kiêm phó giáo sư về AI và đạo đức dữ liệu tại Đại học Công giáo Giáo hoàng Chile – giải thích.

Khắc phục khoảng cách về sự hiện diện văn hóa

Latam-GPT không có ý định cạnh tranh với ChatGPT, Google Gemini hay các công cụ phổ thông tương tự. Thay vào đó, mô hình này hướng tới việc cung cấp một cơ sở hạ tầng nền tảng chính xác và hiệu quả hơn để phát triển thêm các ứng dụng AI dành riêng cho khu vực. Tầm nhìn đằng sau mô hình này trở nên rõ ràng khi nhóm nghiên cứu tại CENIA xem xét dữ liệu của các LLM phổ biến hiện nay.

"Chúng tôi muốn đánh giá mức độ hiện diện của các nền văn hóa, và kết quả cho thấy chưa đến 2% tổng số dữ liệu huấn luyện mà chúng tôi khảo sát có chứa dữ liệu thực tế bằng tiếng Tây Ban Nha hoặc tiếng Bồ Đào Nha", bà Arriagada Bruneau giải thích.

Nhóm nghiên cứu cũng nhận thấy những vấn đề vượt xa phạm vi chỉ đơn thuần là gia tăng nội dung tiếng Tây Ban Nha và tiếng Bồ Đào Nha. Một vấn đề quan trọng khác liên quan đến cách các mô hình AI thể hiện những khác biệt về lịch sử và văn hóa trong khu vực Mỹ Latinh.

Cô nói: “Vấn đề không chỉ là xử lý ngôn ngữ mà còn là những câu hỏi sâu sắc hơn. "Một mô hình nên đề cập đến những khác biệt trong lịch sử như thế nào? Chúng tôi biết rằng cách bạn đào tạo mô hình và cách thức bạn đặt bất kỳ loại bộ lọc hoặc điểm chuẩn nào sẽ có tác động đến cách đầu ra sẽ thể hiện những điều đó."

Để giải quyết hiệu quả những vấn đề này, dự án chủ yếu dựa vào sự hợp tác. CENIA làm việc với các đối tác từ hơn 20 quốc gia Mỹ Latinh, bao gồm các đơn vị học thuật và chính phủ, các tổ chức phi lợi nhuận và cộng đồng địa phương.

Kiểm tra kiến thức thông qua sự tham gia của cộng đồng vào các điểm chuẩn

Cách tiếp cận hợp tác của Latam-GPT cũng đang định hình cách đánh giá mô hình. Bằng cách phát triển các tiêu chuẩn riêng của mình, nhóm có thể kiểm tra mức độ mà các mô hình ngôn ngữ hiểu chính xác kiến ​​thức của khu vực.

Arriagada Bruneau nói: “Chúng tôi đã xây dựng các tiêu chuẩn và tôi nghĩ đây là một cách học tập rất hay”. “Nó đã trở thành một sự đón nhận rất tốt đẹp của cộng đồng về cách chúng tôi nghĩ về các mô hình ngôn ngữ.”

Một trong số đó là Choclo, một chuẩn mực nguồn mở tập trung vào kiến ​​thức văn hóa Mỹ Latinh. Choclo có ý định nắm bắt sự phong phú, đa dạng và đặc trưng của kiến ​​thức văn hóa Mỹ Latinh. Nó chứa hơn 100.000 hàng câu hỏi bao gồm các chủ đề như địa lý, động vật, thực vật, truyền thống, ẩm thực và nhân vật công chúng. Cách tiếp cận này không chỉ là về kiến ​​thức chung mà LLM thường thu được từ Internet mà còn về việc thu hút mọi người cung cấp kiến ​​thức này.

Ngoài Choclo, nhóm còn phát triển tiêu chuẩn nguồn mở Trueque, bao gồm 500 câu hỏi được tuyển chọn để kiểm tra kiến ​​thức thực tế và sự phù hợp về văn hóa. Để đào tạo thêm Latam-GPT, nền tảng trò chuyện tương tác thử nghiệm Copuchat đã được tạo ra để đào tạo mô hình.

Tính mở, quản trị dữ liệu và đạo đức AI

Như Arriagada Bruneau giải thích, tính mở là trọng tâm của dự án, bao gồm cả nguồn mở và trọng số mở (Open Source and Open Weights). Nhóm cũng đang tập trung vào các câu hỏi xung quanh quản trị dữ liệu và đạo đức AI, bao gồm tính minh bạch, quyền riêng tư, thành kiến ​​và đa dạng ngôn ngữ.

“Chúng tôi áp dụng những gì có thể gọi là ‘các nguyên tắc đạo đức truyền thống’ – bao gồm tính minh bạch, trách nhiệm, sự công bằng và việc tính đến các yếu tố thiên kiến,” bà chia sẻ. “Tuy nhiên, chúng tôi cũng cân nhắc, chẳng hạn như các tiêu chí về sự đa dạng ngôn ngữ.”

Phối hợp cùng nhóm GobLab UAI, đội ngũ tại CENIA đã xây dựng một bản công bố thông tin minh bạch, trong đó trình bày chi tiết cơ sở lý giải cho các biện pháp can thiệp dữ liệu của dự án cũng như các tiêu chuẩn về quyền riêng tư được tuân thủ. Do quy định về AI tại Chile còn hạn chế, phần lớn khuôn khổ về AI có trách nhiệm của dự án đều dựa trên cam kết của chính nhóm thực hiện đối với tính mở và đạo đức trong lĩnh vực AI.

Giai đoạn hai: tăng cường năng lực cho Latam-GPT và đẩy mạnh hợp tác khu vực

Khi dự án bước sang giai đoạn hai, trọng tâm được đặt vào việc củng cố khả năng suy luận và giải quyết vấn đề của Latam-GPT, cũng như mở rộng quá trình huấn luyện dựa trên các yếu tố ngữ cảnh. CENIA cũng đang hợp tác với các nhà nhân học, xã hội học và đại diện tư vấn từ nhiều cộng đồng bản địa để tìm kiếm khả năng tích hợp ngôn ngữ và tri thức bản địa vào hệ thống.

Nhằm tăng cường hơn nữa sự hợp tác trong khu vực, nhóm đang xây dựng một liên minh chiến lược với Brazil. Những mối quan hệ hợp tác này không chỉ giúp dự án mở rộng năng lực kỹ thuật mà còn góp phần thách thức quan niệm cho rằng việc phát triển AI bắt buộc phải tuân theo một lộ trình định sẵn.

Đây có thể chính là một trong những đóng góp quan trọng nhất của Latam-GPT. Dự án không chỉ đơn thuần bổ sung dữ liệu từ Mỹ Latinh vào các mô hình AI mà còn tập trung khám phá ý nghĩa thực sự của việc phát triển một mô hình ngay tại khu vực này: “có nhiều cách khác nhau để chúng ta làm chủ công nghệ, biến nó thành công cụ phục vụ nhu cầu và bối cảnh thực tế của các nhóm cộng đồng khác nhau”.

 

Tác giả: admin

Bạn đã không sử dụng Site, Bấm vào đây để duy trì trạng thái đăng nhập. Thời gian chờ: 60 giây