Teknologi

YTL dan NVIDIA Bina 1.35 Juta Rakyat Malaysia Sintetik untuk Latih AI Tempatan

YTL AI Labs dan NVIDIA membina Nemotron-Personas-Malaysia, set data terbuka 1.35 juta rakyat Malaysia sintetik untuk menguji AI konteks Malaysia.


Features Editor · 26 Sep 2026, 1:14pm
YTL dan NVIDIA Bina 1.35 Juta Rakyat Malaysia Sintetik untuk Latih AI Tempatan

YTL AI Labs telah mengeluarkan satu set data 1.35 juta rakyat Malaysia sintetik, yang dibangunkan bersama NVIDIA, dan setiap seorang daripada mereka adalah rekaan. Diumumkan pada 23 September, Nemotron-Personas-Malaysia ialah koleksi terbuka dan percuma manusia rekaan yang dibina untuk menggambarkan corak demografi rasmi negara, supaya pembangun boleh menguji cara sesuatu sistem AI bertindak balas terhadap pelbagai rakyat Malaysia sebelum ia bertemu seorang yang sebenar.

Angkanya menjelaskan kaedahnya. Set ini bermula daripada 150,000 rekod asas, yang dijana daripada taburan kebarangkalian berpaksikan statistik rasmi yang diterbitkan, iaitu Jabatan Perangkaan Malaysia, OpenDOSM, MyCensus, eStatistik dan penerbitan tenaga buruh kebangsaan, kemudian berkembang menjadi 1.35 juta persona dengan 39 medan setiap satu. Setiap persona membawa umur, jantina, pekerjaan, wilayah dan etnik, dan di atas itu personaliti yang dinilai pada model OCEAN, rangka kerja lima faktor yang digunakan ahli psikologi untuk menilai keterbukaan, keberhematan, ekstraversi, keakuran dan neurotisisme seseorang.

Set data Nemotron-Personas-Malaysia: 150,000 rekod asas berkembang menjadi 1.35 juta persona sintetik, 39 medan setiap satu

Apa yang menjadikannya Malaysia ialah butirannya. Koleksi ini menamakan Melayu, Cina, India, Kadazan-Dusun, Bajau, Murut, Iban, Bidayuh dan Melanau antara kumpulannya, dan mempelbagaikannya sehingga peringkat daerah merentasi Sabah, Sarawak dan Semenanjung. Ia juga, kata YTL AI Labs, set data pertama dalam barisan Nemotron-Personas NVIDIA yang mengutamakan Bahasa Melayu berbanding Bahasa Inggeris, satu pilihan yang penting dalam sebuah negara yang mempunyai banyak bahasa ibunda selain Bahasa Inggeris.

Tiada seorang pun daripada mereka wujud. Set data ini tidak mengandungi data peribadi dan, menurut YTL AI Labs, tidak boleh digunakan untuk mengenal pasti mana-mana individu, dan menurut laporan ia diletakkan di Hugging Face di bawah lesen CC BY 4.0 yang membenarkan kegunaan komersial dengan atribusi. Keterbukaan itulah intinya. NVIDIA menonjolkan keluarga Nemotron-Personas yang lebih luas sebagai cara untuk red-team dan mengaudit keadilan sistem dalam bidang seperti perbankan, penjagaan kesihatan dan kerajaan tanpa mendedahkan rekod orang sebenar. Diterapkan di sini, sebuah pasukan yang membina chatbot perbankan atau perkhidmatan kerajaan boleh membina soalan dan senario di sekitar 1.35 juta profil rakyat Malaysia yang pelbagai, satu cara untuk mula menyiasat sama ada sistem mereka bertindak balas secara berbeza terhadap seorang petani Iban yang bersara di Sarawak berbanding seorang profesional muda di Kuala Lumpur.

Rangkaian abstrak nod biru bercahaya dan garis penghubung mewakili set data AI

Bagi Malaysia, ini mengisi jurang tertentu. Kami telah menulis sepanjang tahun tentang negara ini menyusun bahagian-bahagian industri AI buatan tempatan: pelaburan pusat data yang kami jejaki, dorongan untuk meletakkan AI agentik dalam perkhidmatan kerajaan, dan juga cita-cita mereka bentuk cip sendiri. Apa yang ditambah oleh set data seperti ini ialah data terbuka yang kelihatan seperti Malaysia. YTL AI Labs sudah pun membina model yang ditala untuk Malaysia, ILMU-Nemo-30B, jadi perpustakaan profil rakyat Malaysia sintetik ialah pelengkap yang wajar untuknya. "Bersama-sama, keupayaan ini meluaskan maksud membina AI berdaulat di Malaysia," kata Ketua Pegawai Eksekutif YTL AI Labs Foong Chee Mun, menyifatkan pelancaran itu, dalam kenyataan yang dilaporkan The Edge, sebagai "data dan konteks yang diperlukan untuk membentuk cara AI memahami dan melayani rakyat Malaysia."

Ada baiknya kita jelas tentang apa yang boleh dan tidak boleh dilakukan oleh persona sintetik. Ia dijana daripada taburan yang diterbitkan, jadi ia mencerminkan statistik yang kita sudah kumpul, bukan cara sebenar manusia berkelakuan. Bina ujian di sekitarnya dan anda boleh mula melihat sama ada sesuatu sistem bertindak balas secara berbeza terhadap nama Bajau atau alamat Sarawak, walaupun ujian yang adil masih bergantung pada cara anda mereka bentuk soalan dan menilai jawapan. Apa yang ia tidak dapat beritahu anda ialah sama ada jawapan model itu betul, dan ia mewarisi apa sahaja yang tercicir atau dilicinkan oleh banci itu sendiri. Lulus ujian pada 1.35 juta rakyat Malaysia rekaan ialah pintu pertama yang berguna, bukan pengganti kepada meletakkan produk itu di hadapan rakyat sebenar.

Walaupun begitu, hasilnya adalah kedua-duanya dibina khusus untuk Malaysia dan, menurut laporan, terbuka sepenuhnya. Ia berada di Hugging Face sekarang, percuma untuk dimuat turun, dan ia meletakkan Bahasa Melayu di hadapan dan bukan di belakang barisan.

Imej ihsan Febri Adiawarja dan Conny Schneider di Unsplash.

Lagi daripada ProductNation