
Kajian terbaru oleh Data Provenance Initiative, kumpulan penyelidikan yang diketuai MIT, telah mendedahkan krisis yang semakin meningkat dalam ketersediaan data yang digunakan untuk melatih model kecerdasan buatan (AI). Penyelidikan, yang memeriksa 14,000 domain web termasuk dalam tiga yang biasa digunakan AI set data latihan, mendapati bahawa sebahagian besar sumber data berkualiti tinggi kini mengehadkan akses kepada kandungannya.
Kajian ini menganggarkan bahawa dalam set data C4, RefinedWeb dan Dolma, kira-kira 5% daripada semua data dan 25% data daripada sumber berkualiti tinggi telah dihadkan . Sekatan ini dilaksanakan terutamanya melalui Protokol Pengecualian Robot , kaedah yang telah lama digunakan oleh pemilik laman web untuk menghalang bot automatik daripada merayapi halaman mereka menggunakan fail yang dipanggil robots.txt.
Pengarang utama Shayne Longpre memberi amaran, “Kami melihat penurunan pesat dalam persetujuan untuk menggunakan data merentas web yang akan membawa kesan bukan hanya untuk AI syarikat, tetapi untuk penyelidik, ahli akademik dan entiti bukan komersial. Aliran ini boleh memberi kesan ketara kepada pembangunan dan penambahbaikan AI model, yang sangat bergantung pada sejumlah besar data yang pelbagai dan berkualiti tinggi untuk latihan.
Kekurangan data latihan menjadi isu kritikal dalam AI industri. Sebagai AI sistem menjadi lebih canggih dan digunakan untuk tugas yang semakin kompleks, permintaan untuk set data yang kaya dan pelbagai semakin meningkat. Walau bagaimanapun, bekalan data tersebut semakin berkurangan disebabkan oleh pelbagai faktor, termasuk kebimbangan privasi, pertimbangan etika dan tolak balik daripada pencipta kandungan.

Banyak penerbit dan platform dalam talian telah mengambil langkah untuk melindungi data mereka daripada dituai tanpa kebenaran. Ada yang telah menyediakan tembok berbayar atau mengubah syarat perkhidmatannya untuk mengehadkan penggunaan kandungan mereka untuk AI latihan. Yang lain, seperti Reddit dan StackOverflow, telah bermula mengecas AI syarikat-syarikat untuk akses kepada data mereka. Tindakan undang-undang juga telah diambil, dengan The New York Times menyaman TerbukaAI dan Microsoft atas dakwaan pelanggaran hak cipta yang berkaitan dengan penggunaan artikel berita dalam AI latihan.
Implikasi daripada kekurangan data ini adalah meluas. AI model yang dilatih mengenai data yang tidak mencukupi atau berat sebelah mungkin mengalami pengurangan ketepatan, kebolehgeneralisasian terhad dan ketidakupayaan untuk menyesuaikan diri dengan situasi baharu. Ini berpotensi memperlahankan inovasi dalam bidang dan menghalang pembangunan baharu AI permohonan.
Untuk menangani cabaran ini, penyelidik dan AI syarikat sedang meneroka pendekatan alternatif. Ini termasuk teknik pembelajaran aktif, yang menumpukan pada pemilihan titik data yang paling bermaklumat untuk latihan, dan pemindahan pembelajaran, yang memanfaatkan pengetahuan daripada model pra-latihan untuk meningkatkan prestasi pada tugas baharu dengan data terhad.
Sesetengah syarikat juga sedang memeterai perjanjian dengan penerbit untuk mendapatkan akses berterusan kepada kandungan mereka. Contohnya, OpenAI, Google dan Meta baru-baru ini telah memeterai perjanjian dengan organisasi berita seperti The Associated Press dan News Corp untuk memastikan aliran data latihan berkualiti tinggi yang berterusan.
Sebagai AI industri bergelut dengan krisis data yang muncul ini, ia mungkin terpaksa membangunkan cara model latihan yang lebih cekap dan bertanggungjawab. Ini boleh membawa kepada inovasi dalam pengumpulan data, penggunaan dan juga paradigma pembelajaran yang sama sekali baharu yang kurang bergantung pada set data besar-besaran.
. mengkaji's penemuan menekankan keperluan untuk pendekatan yang seimbang untuk AI pembangunan yang menghormati hak harta intelek dan kebimbangan privasi sambil tetap memupuk inovasi. Sebagai landskap AI data latihan terus berkembang, kerjasama antara syarikat teknologi, pencipta kandungan dan penggubal dasar akan menjadi penting dalam menavigasi cabaran ini dan memastikan pertumbuhan mampan AI teknologi.


