Amazon ignoriert KI-Benchmarks, weil sie ungenau sind!

Amazon ignoriert KI-Benchmarks, weil sie ungenau sind!

Ondřej Barták
Ondřej Barták
Unternehmer und Programmierer
3. 12. 2025
3 Minuten Lesezeit · 3 Aufrufe
Amazon ignoriert KI-Benchmarks, weil sie ungenau sind!

Heute überbieten sich große Unternehmen wie OpenAI, Anthropic und Google gegenseitig in den Leistungsrankings für künstliche Intelligenz, doch Amazon sagt: „Schaut nicht auf diese Tabellen.“ Das ist die zentrale Botschaft der jüngsten Ankündigungen auf der AWS-re:Invent-Konferenz in Las Vegas. Rohit Prasad, Amazons Vizepräsident für AGI (künstliche allgemeine Intelligenz), erläuterte dies im Vorfeld. Ihm zufolge spiegeln diese Benchmarks, also Tests zur Leistungsfähigkeit von Modellen, nicht die tatsächliche Stärke der KI wider. „Ich will einen realen Nutzen. Keiner dieser Benchmarks ist wirklichkeitsnah“, sagte Prasad. Und der Grund? Jeder verwendet andere Trainingsdaten, und die Tests sind nicht ausreichend von ihnen getrennt, sodass die Ergebnisse voller Störsignale sind und nicht die wahre Stärke der Modelle offenbaren.

Amazon verfolgt einen anderen Ansatz. Statt Spitzenplätzen in Rankings wie LMArena hinterherzujagen, wo die vorherige Version seines Nova-Modells auf Platz 79 landete, konzentriert sich das Unternehmen auf die praktische Nutzung. Prasad betonte, dass Benchmarks nicht funktionieren, weil sie nicht standardisiert sind – alle müssten dieselben Daten verwenden, und die Tests müssten vollständig davon getrennt sein, doch das ist nicht der Fall. Daher sind diese Rankings eher ein Marketingtrick als ein Maßstab für den tatsächlichen Wert.

Rohit Prasad
Rohit Prasad

Nova Forge

Die wichtigste Neuerung ist der Dienst Nova Forge, den Amazon als eine Möglichkeit vorgestellt hat, mit der Unternehmen eigene KI-Modelle ohne Kosten in Milliardenhöhe trainieren können. Das Problem, das Forge löst, ist real: Die meisten Unternehmen haben drei schlechte Optionen. Entweder passen sie ein geschlossenes Modell nur oberflächlich an, oder sie trainieren offene Modelle ohne die ursprünglichen Daten und riskieren, dass das Modell sein breites Wissen vergisst, oder sie bauen alles für enorme Summen von Grund auf neu.

Forge macht es anders. Es bietet Zugriff auf Checkpoints des Nova-Modells in verschiedenen Phasen – vor, während und nach dem Training. So können Unternehmen ihre eigenen Daten frühzeitig einbringen, wenn das Modell, wie Prasad es beschrieb, am „lernfähigsten“ ist. „Wir haben die Entwicklung fortschrittlicher Modelle für Ihre Anforderungen zu einem Bruchteil der Kosten demokratisiert“, sagte er. Dieses Tool entstand, weil die internen Teams von Amazon es haben wollten – ähnlich wie AWS (Amazons Cloud-Dienst) als internes Werkzeug für das eigene Geschäft begann und zur wichtigsten Gewinnquelle wurde.

Reddit nutzt Forge bereits

Reddit testet Forge bereits für seine eigenen Sicherheitsmodelle, die mit Daten aus 23 Jahren Community-Moderation trainiert werden. Chris Slowe, Chief Technology Officer und erster Mitarbeiter von Reddit, sagte: „Ich habe noch nie etwas Vergleichbares gesehen.“ Ihr Ingenieur verhalte sich angeblich wie ein Kind im Süßwarenladen. Vergangene Woche starteten sie ein Training, das vielversprechend aussieht. Ziel ist es, mehrere spezialisierte Modelle durch ein einziges zu ersetzen, das die Nuancen der Moderation versteht, einschließlich der subjektiven Regel „Sei kein Idiot“, die überall in den Subreddits zu finden ist.

Slowe erklärte, dass Forge es Reddit ermöglicht, die eigenen Modelle zu kontrollieren, Änderungen an den APIs anderer Anbieter zu vermeiden, die Modellgewichte zu besitzen und keine sensiblen Daten nach außen zu übermitteln. Sie planen bereits einen ähnlichen Ansatz für Reddit Answers und weitere Produkte. Auf die Frage, ob es störe, dass Nova in den Benchmarks nicht an der Spitze steht, antwortete Slowe unverblümt: „In diesem Kontext kommt es auf die Expertise des Modells in Bezug auf Reddit an.“ Amazon betont somit Kontrolle und Spezialisierung statt roher Intelligenz.

Infrastruktur statt Intelligenz

Amazon setzt darauf, dass der Wettlauf um die Modelle zu einer austauschbaren Standardware geworden ist, und will erfolgreich sein, indem es einen Ort bietet, an dem Unternehmen maßgeschneiderte KI für konkrete Probleme entwickeln können. Das ist der typische AWS-Ansatz: Infrastruktur und Anpassung statt roher Leistung. Damit vermeidet Amazon einen direkten Vergleich mit OpenAI oder Anthropic, mit denen das Unternehmen zuvor auf Modellebene konkurrieren wollte.

Der Erfolg von Forge hängt davon ab, ob die Entwickler den Dienst annehmen. Amazon behauptet, dass der traditionelle Wettlauf um die Modelle keine Rolle spielt. Sollte das stimmen, wird sich der Maßstab für den Erfolg dahingehend verschieben, ob KI in der Praxis tatsächlich einen realen Mehrwert schafft.

Quelle: theverge.com

Werbung

Inhalte entstehen mit Unterstützung von UpTier.

SEO und GEO auf Autopilot. Die Multiagentensysteme von UpTier schreiben und optimieren Inhalte für Suchmaschinen und KI-Antworten.

UpTier entdecken ↗

Kategorie:KI
Hat Ihnen dieser Artikel gefallen?
Entdecken Sie weitere interessante Beiträge im Blog
Zurück zum Blog

Ähnliche Beiträge

ChatGPT führt virtuelle Anprobe für Kleidung und Accessoires einChatGPT führt virtuelle Anprobe für Kleidung und Accessoires ein
OpenAI startet weltweit zwei Shopping-Funktionen in ChatGPT: Nutzer können Kleidung und Accessoires auf einem eigenen Foto visualisieren und ausgewählte Produkte mit Favorites speichern.
1 Min. Lesezeit
2. 10. 2026
Codex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät ausCodex erhält wiederverwendbare Cloud-Umgebungen mit Zugriff von jedem Gerät aus
OpenAI erweitert Codex um wiederverwendbare Cloud-Arbeitsumgebungen. Hinzu kommen Sprachsteuerung im CLI, Code-Reviews in der ChatGPT-Desktop-App und Sicherheitsprüfungen für GitHub-Repositories.
2 Min. Lesezeit
2. 10. 2026
Amazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-WorkflowsAmazon veröffentlicht Strands Decider 2B für Entscheidungen in Agenten-Workflows
Strands Decider 2B wählt zwischen vorgegebenen Optionen und liefert dazu einen Konfidenzwert. Das neue Entscheidungsmodell von AWS ist vollständig Open Source und lässt sich lokal betreiben.
2 Min. Lesezeit
1. 10. 2026
Přihlaste se k odběru našeho newsletteru
Zůstaňte informováni o nejnovějších příspěvcích, exkluzivních nabídkách, a aktualizacích.
CodedTrip

Betreiber: CodedTrip LLC, USA.

YouTube
TikTok