KI-Benchmarks sind wesentlich für die Bewertung der Leistung eines Modells. Hier ist ein Blick darauf, was Benchmarks leisten können und was nicht.

Google DeepMind via Pexels
Studierende absolvieren standardisierte Tests in der Schule, um ihre Leistung im Verhältnis zu ihren Mitschülern zu bewerten. Das gleiche Prinzip liegt den Benchmarks für künstliche Intelligenz (KI) zugrunde, die die Fähigkeiten jedes Modells testen und den Unternehmen zeigen, wo sie sich verbessern müssen. Auch wenn es keinen perfekten Test gibt, können Benchmarks KI-Unternehmen helfen, sicherere und verlässlichere Modelle für den persönlichen und geschäftlichen Gebrauch zu erstellen.

Neeqolah Creative Works via Unsplash
Ein KI-System ist ein Modell, das verwendet, um Daten zu analysieren, Inhalte zu generieren und Urteile zu fällen. Bevor Unternehmen KI-Systeme der Öffentlichkeit zugänglich machen, durchlaufen die Modelle Schulungs- und Testphasen. Doch selbst nach strengen Tests können Modelle liefern oder schädliche Inhalte generieren.
Schließen Sie sich über 500.000 Lesern an, die ihren Tag mit Quartz beginnen.
Mit dem Abonnieren stimmen Sie unseren Nutzungsbedingungen und unserer Datenschutzrichtlinie zu.
Hier kommen AI-Benchmarks ins Spiel. Ein Benchmark ist ein Test, der die Leistung des Modells bewertet und mit anderen Systemen oder einem standardisierten Satz von Antworten vergleicht. Wenn Unternehmen die Ergebnisse erhalten, können sie Bereiche erkennen, die verbessert werden müssen, und beurteilen, wie ihre Modelle im Vergleich zu anderer KI-Software auf dem Markt abschneiden.
Während des Tests absolvieren AI-Modelle eine Reihe von Aufgaben, die das Abrufen von Informationen aus einem Frage- oder Bilddatensatz umfassen können. Zu den häufigen Aufgaben gehören Übersetzung, Objekterkennung, Codegenerierung, Sprachverständnis und logisches Denken. Danach erhalten die Entwickler eine Testbewertung, die ihnen hilft, die Nützlichkeit ihres Modells einzuschätzen.
Die Ergebnisse können folgende Metriken umfassen:
Einige der bekanntesten KI-Benchmarks sind:
Benchmark-Ergebnisse zeigen Entwicklern, wie gut ihre KI im Vergleich zu anderen Modellen abschneidet. Nachdem sie die Stärken und Schwächen ihres Modells analysiert haben, können sie es der Öffentlichkeit zugänglich machen oder die Software weiter optimieren, um ihre Punktzahl zu verbessern. Dies hilft Entwicklern, Ziele zu setzen und ihre Fristen einzuhalten.
Darüber hinaus bieten Benchmarks einen Einblick in den Gesamtfortschritt der KI. Wenn Modelle diese Prüfungen bestehen, erstellen Entwickler fortschrittlichere Benchmarks, die die KI herausfordern, neue Höhen zu erreichen. Diese Prüfungen können größere Datensätze, höhere Standards, zunehmend schwierigere Aufgaben und mehr Ressourcen für Entwickler enthalten.
Mit diesen Informationen können Unternehmen das beste Modell für ihre Aufgaben auswählen. Abhängig von ihren Bedürfnissen möchten sie möglicherweise Software, die in Übersetzung, Textanalyse, Bilderkennung, Mathematik, Vorhersagen oder Schreiben hervorragend ist. Hohe Benchmark-Ergebnisse können Unternehmen das Vertrauen geben, dass sie in die richtige Software investieren.
Obwohl Benchmarks Entwicklern eine allgemeine Vorstellung von der Effektivität ihres Modells geben, können sie die Leistung der Software in realen Situationen nicht vorhersagen. Benchmarks unterziehen Modelle einer begrenzten Anzahl von Tests in einer kontrollierten Umgebung. Sobald die Öffentlichkeit jedoch beginnt, diese Modelle zu verwenden, werden sie Szenarien entwickeln, die die Benchmark-Ersteller nie in Betracht gezogen haben.
Infolgedessen ist es unmöglich, vorherzusagen, wie eine KI in jeder Situation reagieren wird. Benchmarks sind ein nützliches Werkzeug, stellen jedoch keine Garantie dar.
Ebenso beweist ein hoher Benchmark-Wert nicht, dass das KI-Modell Daten wie ein menschlicher Benutzer versteht. Das Modell könnte hervorragend darin sein, Testfragen zu beantworten, jedoch Schwierigkeiten mit logischem Denken, Verständnis und Analyse haben, was es für Unternehmen weniger nützlich macht, die tiefes Denken von ihrer Software erwarten.
Im Allgemeinen testen Benchmarks die technischen Fähigkeiten des Modells, wie z.B. Objekterkennung und Sprachverständnis. Sie bewerten jedoch nicht die Fähigkeit der KI, fair und ethisch zu handeln, auf ungewöhnliche Eingaben zu reagieren oder kreative Antworten zu liefern. Für diese Aufgaben muss ein Modell möglicherweise mit menschlichen Testern trainiert werden.
Benchmarks können Entwickler dazu ermutigen, "den Test zu lehren", indem sie Bots erstellen, die ihre Prüfungen bestehen, jedoch reale Herausforderungen wie das Zusammenfassen von Dokumenten oder das Erstellen von Gedichten nicht meistern. Wenn Unternehmen ihre Modelle mit einem begrenzten Datensatz trainieren, könnte die Software fehlerhaft reagieren, wenn sie auf eine Eingabe stößt, die sie noch nie zuvor gesehen hat.
Diese Datensätze könnten ebenfalls Voreingenommenheiten die die Bewertungen des Modells beeinflussen oder es dazu ermutigen, schädliche Materialien zu produzieren. Wenn Scraper beispielsweise Text und Bilder für diese Datensätze sammeln, können sie rassistische oder sexistische Materialien enthalten, die zu Mikroaggressionen führen.
Viele Benchmarks sind veraltet, was zu fehlerhaften Ergebnissen führt. Während ein Modell eine perfekte Punktzahl erzielen könnte, könnte der Test Informationen von alten oder defekten Websites gezogen haben, die ungenaue Daten hosteten. Dies erfordert, dass Unternehmen ihre Modelle erneut mit fortschrittlichen Benchmarks testen, wie zum Beispiel dem ultra-herausfordernden "Humanity's Last Exam."
Darüber hinaus sind einige Aufgaben einfach schwer zu bewerten. Ein Benchmark könnte ein Modell auf grundlegende Fakten testen, aber es könnte Schwierigkeiten haben, fortgeschrittene Konzepte zu verstehen, wie zum Beispiel ein originelles Lied zu schreiben oder Fangfragen zu beantworten. Ohne rigoroses Training könnte eine KI die Nutzer enttäuschen, indem sie es versäumt, erwartete menschliche Eigenschaften, wie gesunden Menschenverstand, nachzuahmen.