Jakarta, Nusantara Expost.com – Kumpulan data gambar berkualitas tinggi menunjukkan bahwa perusahaan teknologi dapat memperoleh persetujuan berdasarkan informasi dan menghindari bias data tanpa mengeluarkan banyak biaya.
Sudah menjadi fakta yang hampir diakui secara universal bahwa aplikasi kecerdasan buatan generatif yang banyak digunakan dibangun dengan data yang dikumpulkan dari internet. Hal ini dilakukan, sebagian besar, tanpa mendapatkan persetujuan dari orang-orang dan tanpa memberikan kompensasi kepada individu yang datanya ‘diambil’ dengan cara ini.
Namun, sebuah artikel penelitian kini menunjukkan bahwa, dalam hal gambar, cara lain dimungkinkan. Para peneliti di raksasa teknologi dan hiburan global Sony mendeskripsikan kumpulan data gambar yang bersumber secara bertanggung jawab yang dapat digunakan untuk mengukur akurasi AI generatif. Pekerjaan itu rumit, namun tidak menghabiskan banyak biaya. Biaya pengumpulan data—kurang dari US$1 juta—sangat kecil bagi banyak perusahaan teknologi.
Regulator dan penyandang dana perlu memperhatikan hal ini. Demikian pula halnya dengan semua pihak yang terlibat dalam litigasi terkait kebolehan pengikisan data orang—dalam bentuk apa pun—untuk melatih dan menguji model AI generatif. Menciptakan data yang bersumber secara bertanggung jawab dan representatif dimungkinkan jika masalah persetujuan dan akurasi ditangani secara eksplisit.

Ada pula pesan penting bagi korporasi: inilah peluang bagi perusahaan untuk bekerja sama demi kepentingan semua orang. Ada kalanya perusahaan perlu bersaing dan ada kalanya mereka harus berkolaborasi. Di halaman-halaman ini, kami sering kali menyuarakan pentingnya kolaborasi yang lebih baik. Jika ada contoh mengapa kemitraan semacam itu dibutuhkan, inilah contohnya.
Tidak diragukan lagi bahwa informasi digital pribadi, yang terkadang dapat diidentifikasi, telah digunakan untuk membangun aplikasi AI generatif. Data tersebut mencakup materi dari blog dan konten di platform media sosial, gambar dan video yang sering kali menampilkan orang, serta karya berhak cipta seperti lukisan dan patung, buku, musik, dan film.
Jangan Beranjak Dari Penelitian Visi Komputer Ke Pengawasan
Sebagian besar negara memiliki undang-undang yang mengatur pengumpulan data. Undang-undang ini mencakup kebutuhan untuk mendapatkan izin guna melindungi privasi dan hak kekayaan intelektual seseorang. Izin tersebut seringkali mengharuskan pengumpul data untuk menjelaskan penggunaan data tersebut, termasuk kemampuan untuk memilih keluar, dan, jika sesuai, memberikan kompensasi kepada orang yang menyediakan data. Meskipun demikian, perusahaan yang mengembangkan beberapa model bahasa besar terbesar yang tersedia untuk umum belum secara rutin mengikuti praktik ini. Dalam beberapa kasus, firma berpendapat bahwa persetujuan tidak diperlukan jika seseorang telah menyediakan materi mereka di internet, dan bahwa apa yang mereka lakukan merupakan ‘penggunaan wajar’ atas data yang tersedia untuk umum. Hal ini merupakan perdebatan yang kontroversial dan dipertanyakan oleh badan pengatur dan organisasi yang mewakili pemegang hak cipta, seperti penulis dan seniman.
Di sinilah kumpulan data baru ini — yang disebut Fair Human-Centric Image Benchmark (FHIBE) atau ‘Feebee’ — berbeda. Alice Xiang, kepala tata kelola AI global Sony, dan rekan-rekannya memperoleh persetujuan berdasarkan informasi dari 1.981 individu dari 81 negara dalam kumpulan data tersebut. Setiap individu diberi tahu dalam bahasa yang mudah dipahami tentang data apa yang dibutuhkan dan bagaimana data tersebut dapat digunakan — aplikasi yang melibatkan penegakan hukum, militer, persenjataan, dan pengawasan secara tegas dilarang berdasarkan ketentuan penggunaan. Peserta dibayar untuk materi mereka dan dapat memilih untuk berhenti berlangganan kapan saja.
Apresiasi Untuk Studi AI Yang Tidak Menjadi Berita Utama
FHIBE juga berbeda dari kumpulan data gambar yang ada dalam hal penting lainnya: data ini mencakup proporsi orang dan foto yang jauh lebih besar dari negara-negara di Afrika, Asia, dan Oseania. Selain itu, dalam kumpulan data FHIBE, peserta memberikan usia, leluhur, lokasi geografis, dan kata ganti mereka, sehingga menghilangkan kebutuhan algoritma untuk menebak karakteristik ini dari nama atau penampilan seseorang. Hal ini penting karena berarti kumpulan data FHIBE merupakan cerminan dunia nyata yang lebih akurat daripada banyak data yang tidak seimbang yang dikumpulkan dari data yang dikeruk dari web.
Selain menjadi bukti konsep yang penting, studi ini menyediakan cara bagi perusahaan untuk mengukur akurasi aplikasi gambar AI yang ada. Para peneliti juga harus memanfaatkan kesempatan ini untuk menyelidiki beberapa pertanyaan besar yang belum terjawab. Misalnya, dapatkah kumpulan data serupa dibuat untuk mengukur akurasi perangkat AI berbasis teks? Bagaimana data yang bersumber secara bertanggung jawab dapat diproduksi dalam skala yang dibutuhkan untuk melatih, bukan hanya sebagai pembanding, model bahasa yang besar, dan berapa skala yang seharusnya?
Xiang dan tim penelitinya telah menunjukkan cara memproduksi dan menguji sistem AI yang bertanggung jawab. Mereka telah memilih masalah yang sulit, tetapi ini seharusnya bukan perjuangan mereka sendiri. Pihak lain harus bergabung dalam upaya ini agar kita dapat membangun aplikasi AI sesuai dengan standar akurasi dan etika tertinggi.






