Data untuk AI Latihan Menghilang Pantas, Kajian Baru Mendedahkan

Data untuk AI Latihan Cepat Hilang, Rancangan Kajian

Kajian terbaru oleh Data Provenance Initiative, kumpulan penyelidikan yang diketuai MIT, telah mendedahkan krisis yang semakin meningkat dalam ketersediaan data yang digunakan untuk melatih model kecerdasan buatan (AI). Penyelidikan, yang memeriksa 14,000 domain web termasuk dalam tiga yang biasa digunakan AI set data latihan, mendapati bahawa sebahagian besar sumber data berkualiti tinggi kini mengehadkan akses kepada kandungannya.

Kajian ini menganggarkan bahawa dalam set data C4, RefinedWeb dan Dolma, kira-kira 5% daripada semua data dan 25% data daripada sumber berkualiti tinggi telah dihadkan . Sekatan ini dilaksanakan terutamanya melalui Protokol Pengecualian Robot , kaedah yang telah lama digunakan oleh pemilik laman web untuk menghalang bot automatik daripada merayapi halaman mereka menggunakan fail yang dipanggil robots.txt.

Pengarang utama Shayne Longpre memberi amaran, “Kami melihat penurunan pesat dalam persetujuan untuk menggunakan data merentas web yang akan membawa kesan bukan hanya untuk AI syarikat, tetapi untuk penyelidik, ahli akademik dan entiti bukan komersial. Aliran ini boleh memberi kesan ketara kepada pembangunan dan penambahbaikan AI model, yang sangat bergantung pada sejumlah besar data yang pelbagai dan berkualiti tinggi untuk latihan.

Kekurangan data latihan menjadi isu kritikal dalam AI industri. Sebagai AI sistem menjadi lebih canggih dan digunakan untuk tugas yang semakin kompleks, permintaan untuk set data yang kaya dan pelbagai semakin meningkat. Walau bagaimanapun, bekalan data tersebut semakin berkurangan disebabkan oleh pelbagai faktor, termasuk kebimbangan privasi, pertimbangan etika dan tolak balik daripada pencipta kandungan.

AI Syarikat Abaikan Peraturan Web untuk Mengikis Kandungan Penerbit

Banyak penerbit dan platform dalam talian telah mengambil langkah untuk melindungi data mereka daripada dituai tanpa kebenaran. Ada yang telah menyediakan tembok berbayar atau mengubah syarat perkhidmatannya untuk mengehadkan penggunaan kandungan mereka untuk AI latihan. Yang lain, seperti Reddit dan StackOverflow, telah bermula mengecas AI syarikat-syarikat untuk akses kepada data mereka. Tindakan undang-undang juga telah diambil, dengan The New York Times menyaman TerbukaAI dan Microsoft atas dakwaan pelanggaran hak cipta yang berkaitan dengan penggunaan artikel berita dalam AI latihan.

Implikasi daripada kekurangan data ini adalah meluas. AI model yang dilatih mengenai data yang tidak mencukupi atau berat sebelah mungkin mengalami pengurangan ketepatan, kebolehgeneralisasian terhad dan ketidakupayaan untuk menyesuaikan diri dengan situasi baharu. Ini berpotensi memperlahankan inovasi dalam bidang dan menghalang pembangunan baharu AI permohonan.

Untuk menangani cabaran ini, penyelidik dan AI syarikat sedang meneroka pendekatan alternatif. Ini termasuk teknik pembelajaran aktif, yang menumpukan pada pemilihan titik data yang paling bermaklumat untuk latihan, dan pemindahan pembelajaran, yang memanfaatkan pengetahuan daripada model pra-latihan untuk meningkatkan prestasi pada tugas baharu dengan data terhad.

Sesetengah syarikat juga sedang memeterai perjanjian dengan penerbit untuk mendapatkan akses berterusan kepada kandungan mereka. Contohnya, OpenAI, Google dan Meta baru-baru ini telah memeterai perjanjian dengan organisasi berita seperti The Associated Press dan News Corp untuk memastikan aliran data latihan berkualiti tinggi yang berterusan.

Sebagai AI industri bergelut dengan krisis data yang muncul ini, ia mungkin terpaksa membangunkan cara model latihan yang lebih cekap dan bertanggungjawab. Ini boleh membawa kepada inovasi dalam pengumpulan data, penggunaan dan juga paradigma pembelajaran yang sama sekali baharu yang kurang bergantung pada set data besar-besaran.

. mengkaji's penemuan menekankan keperluan untuk pendekatan yang seimbang untuk AI pembangunan yang menghormati hak harta intelek dan kebimbangan privasi sambil tetap memupuk inovasi. Sebagai landskap AI data latihan terus berkembang, kerjasama antara syarikat teknologi, pencipta kandungan dan penggubal dasar akan menjadi penting dalam menavigasi cabaran ini dan memastikan pertumbuhan mampan AI teknologi.

https://twitter.com/kevinroose/status/1814320101962957235

Sila tinggalkan balasan anda

Alamat e-mel anda tidak akan disiarkan. Medan yang diperlukan ditanda *

Laman ini menggunakan Akismet untuk mengurangkan spam. Ketahui cara data komen anda diproses.

Menyertai Aimojo Puak!

Sertai 76,200+ ahli untuk mendapatkan petua orang dalam setiap minggu! 
🎁 BONUS: Dapatkan $200 kamiAI Mastery Toolkit” PERCUMA apabila anda mendaftar!

tren AI Alatan
Hayati AI

Bahasa Arab pertama AI platform teman wanita yang dibina untuk dialek MENA Sembang, suara, foto dan lakon peranan tanpa penapis dengan orang Arab anda AI gadis Bertutur Najdi, Hijazi, Teluk, Iraq, Mesir dan banyak lagi — persendirian, 24/7

EaseMate AI

Semua-dalam-satu AI pembantu untuk belajar, bekerja dan kreativiti AI sembang, ChatPDF, penyelesai kerja rumah, penjana imej dan penjana video dalam satu ruang kerja

Gumloop

Bina dan Skalakan AI Ejen Yang Sebenarnya Melakukan Kerja Berbilang pemain AI pembina ejen untuk pasukan GTM dan operasi hasil.

Tahan Lama

Bina dan Jalankan Seluruh Perniagaan Kecil Anda Daripada Satu AI platform Yang terpantas AI pembina laman web dengan CRM, invois dan alat pemasaran terbina dalam.

FreeNudifier

Percuma AI membogelkan dengan output HD dan tiada pendaftaran Penyuntingan imej dewasa berasaskan pelayar dibina untuk hasil yang pantas

© Hak Cipta 2023 - 2026 | Menjadi seorang AI Pro | Dibuat dengan ♥