Daten für AI Neue Studie zeigt: Ausbildung verschwindet schnell

Daten für AI Studie zeigt: Training verschwindet schnell

Eine aktuelle Studie der Data Provenance Initiative, einer vom MIT geleiteten Forschungsgruppe, hat eine wachsende Krise bei der Verfügbarkeit von Daten offenbart, die zum Trainieren von Modellen der künstlichen Intelligenz (KI) verwendet werden. Die Forschung, die 14,000 Webdomänen untersucht in drei häufig verwendeten AI Trainingsdatensätze, stellten fest, dass bei einem erheblichen Teil hochwertiger Datenquellen der Zugriff auf ihre Inhalte mittlerweile eingeschränkt ist.

Die Studie schätzt, dass in den Datensätzen C4, RefinedWeb und Dolma etwa 5 % aller Daten und 25 % der Daten aus den qualitativ hochwertigsten Quellen eingeschränkt sind . Diese Einschränkungen werden hauptsächlich durch das Robots Exclusion Protocol (ROP) umgesetzt , eine etablierte Methode, mit der Website-Betreiber mithilfe einer robots.txt-Datei verhindern können, dass automatisierte Bots ihre Seiten durchsuchen.

Der Hauptautor Shayne Longpre warnt: „Wir sehen einen rapiden Rückgang der Zustimmung zur Nutzung von Daten im gesamten Web, der nicht nur Auswirkungen haben wird auf AI Unternehmen, sondern für Forscher, Akademiker und nichtkommerzielle Einrichtungen.“ Dieser Trend könnte die Entwicklung und Verbesserung von AI für, die für ihr Training in hohem Maße auf große Mengen unterschiedlicher und qualitativ hochwertiger Daten angewiesen sind.

Der Mangel an Trainingsdaten wird zu einem kritischen Problem in der AI Industrie. Als AI Systeme werden immer ausgefeilter und für immer komplexere Aufgaben eingesetzt, die Nachfrage nach umfangreichen, vielfältigen Datensätzen steigt. Das Angebot an solchen Daten schrumpft jedoch aufgrund verschiedener Faktoren, darunter Datenschutzbedenken, ethische Überlegungen und Widerstand von Inhaltsentwickler.

AI Unternehmen ignorieren Web-Regeln, um Inhalte von Herausgebern zu scrapen

Viele Verlage und Online-Plattformen haben Maßnahmen ergriffen, um ihre Daten vor unerlaubter Erfassung zu schützen. Einige haben Paywalls eingerichtet oder ihre Nutzungsbedingungen geändert haben die Nutzung ihrer Inhalte einzuschränken für AI Training. Andere, wie Reddit und StackOverflow, haben begonnen aufladen AI Unternehmen für den Zugriff auf ihre Daten. Auch rechtliche Schritte wurden eingeleitet, die New York Times verklagte OpenAI und Microsoft wegen angeblicher Urheberrechtsverletzung im Zusammenhang mit der Verwendung von Nachrichtenartikeln in AI Ausbildung.

Die Folgen dieses Datenmangels sind weitreichend. AI Modelle, die mit unzureichenden oder verzerrten Daten trainiert wurden, weisen möglicherweise eine geringere Genauigkeit, eingeschränkte Generalisierbarkeit und eine mangelnde Anpassungsfähigkeit an neue Situationen auf. Dies könnte möglicherweise die Innovation in diesem Bereich verlangsamen und die Entwicklung neuer AI um weitere Anwendungsbeispiele zu finden.

Um diese Herausforderungen zu bewältigen, haben Forscher und AI Unternehmen erforschen alternative Ansätze. Dazu gehören aktive Lerntechniken, die sich auf die Auswahl der aussagekräftigsten Datenpunkte für das Training konzentrieren, und Transferlernen, das Wissen aus vorgefertigte Modelle um die Leistung bei neuen Aufgaben mit begrenzten Daten zu verbessern.

Einige Unternehmen schließen zudem Verträge mit Verlagen ab, um sich den dauerhaften Zugriff auf deren Inhalte zu sichern. So haben beispielsweise OpenAI, Google und Meta kürzlich Vereinbarungen mit Nachrichtenorganisationen wie der Associated Press und News Corp getroffen, um einen kontinuierlichen Nachschub an hochwertigen Trainingsdaten zu gewährleisten.

Da der AI Die Branche muss sich mit der sich abzeichnenden Datenkrise auseinandersetzen und muss möglicherweise effizientere und verantwortungsvollere Methoden zur Modellschulung entwickeln. Dies könnte zu Innovationen bei der Datenerfassung und -nutzung und sogar zu völlig neuen Lernparadigmen führen, die weniger von riesigen Datensätzen abhängig sind.

Das Studie's Befund unterstreichen die Notwendigkeit eines ausgewogenen Ansatzes für AI Entwicklung, die geistige Eigentumsrechte und Datenschutzbedenken respektiert und gleichzeitig Innovationen fördert. Da die Landschaft der AI Trainingsdaten entwickeln sich weiter. Die Zusammenarbeit zwischen Technologieunternehmen, Inhaltserstellern und politischen Entscheidungsträgern wird entscheidend sein, um diese Herausforderungen zu meistern und das nachhaltige Wachstum von AI Technologien.

https://twitter.com/kevinroose/status/1814320101962957235

Schreiben Sie bitte einen Kommentar.

Ihre E-Mail-Adresse wird nicht veröffentlicht. Pflichtfelder sind mit * gekennzeichnet.

Diese Website verwendet Akismet, um Spam zu reduzieren. Erfahren Sie mehr darüber, wie Ihre Kommentardaten verarbeitet werden.

TRETEN SIE DEM Aimojo Stamm!

Werden Sie eines von über 76,200 Mitgliedern und erhalten Sie jede Woche Insidertipps! 
🎁 BONUS: Holen Sie sich unsere 200 $“AI „Mastery Toolkit“ KOSTENLOS bei der Anmeldung!

Trending AI Zubehör
Gumloop

Erstellen und Skalieren AI Agenten, die tatsächlich die Arbeit erledigen Der Multiplayer AI Agenten-Builder für GTM- und Revenue-Operations-Teams.

Langlebig

Bauen und betreiben Sie Ihr gesamtes Kleinunternehmen von einem einzigen Ort aus AI Plattform Der schnellste AI Website-Baukasten mit integriertem CRM, Rechnungsstellung und Marketing-Tools.

FreeNudifier

Frei AI Nacktaufnahmen mit HD-Ausgabe und ohne Anmeldung Browserbasierte Bildbearbeitung für Erwachsene – entwickelt für schnelle Ergebnisse

Vividoo

Verwandeln Sie jedes Immobilienfoto in Sekundenschnelle in eine fotorealistische Design-Darstellung. AI Studio für Innen- und Außendesign für Hausbesitzer, Makler und Designer

Cheat-Schicht

Automatisieren Sie Ihren gesamten Geschäftswachstumsmotor mit AI Agenten, die rund um die Uhr arbeiten Browser- und Desktop-Automatisierung ohne Programmierung, unterstützt durch GPT

© Copyright 2023 - 2026 | Werden Sie ein AI Pro | Mit ♥ gemacht