Die schnellste und günstigste Version Gemini 2.5 Flash-Lite ist da
Am 22. Juli 2025 gaben Logan Kilpatrick und Zach Gleicher im Google Developers Blog bekannt, dass das Modell Gemini 2.5 Flash-Lite eine stabile Version erreicht hat und nun allgemein verfügbar ist. Dieses Modell ist das schnellste und günstigste der Gemini-2.5-Familie und wurde speziell für Aufgaben entwickelt, bei denen Latenz (Verzögerung) und Kosten eine wichtige Rolle spielen, etwa Übersetzungen oder Klassifizierungen. Mit einem Preis von nur 0,10 USD pro 1 Million Eingabe-Token und 0,40 USD pro 1 Million Ausgabe-Token ermöglicht es die Verarbeitung großer Mengen von Anfragen ohne hohe Kosten. Zudem wurde der Preis für Audioeingaben gegenüber der Testversion um 40 % gesenkt.
Hauptmerkmale des Modells
Gemini 2.5 Flash-Lite zeichnet sich bei einer breiten Palette von Prompts durch eine geringere Latenz als die Modelle 2.0 Flash-Lite und 2.0 Flash aus. Es bietet ein Kontextfenster von bis zu 1 Million Token und ermöglicht damit die Verarbeitung komplexer Aufgaben. Es unterstützt native Tools wie Grounding with Google Search (Fundierung mit der Google-Suche), Code Execution (Codeausführung) und URL Context (Kontext aus URLs). Das Modell wurde mit Daten bis Januar 2025 trainiert, und für anspruchsvollere Anwendungsfälle kann optional erweitertes Schlussfolgern aktiviert werden. Es ist multimodal und verarbeitet somit Text, Bilder, Dokumente, Videos und Audio, wobei die Eingabe auf 500 MB begrenzt ist.
Praktische Anwendungsbeispiele
Bereits seit der Testversion hat sich das Modell in der Praxis bewährt. Das Unternehmen Satlyt nutzt es für eine dezentrale Plattform für Weltraum-Computing und erzielte damit bei der Diagnose im Orbit eine Verringerung der Latenz um 45 % sowie eine Senkung des Energieverbrauchs um 30 %. HeyGen automatisiert damit die Videoplanung, optimiert Inhalte und übersetzt für eine globale Personalisierung in mehr als 180 Sprachen. DocsHound verarbeitet lange Videos und extrahiert Tausende Screenshots mit geringer Latenz, wodurch die Erstellung von Dokumentationen beschleunigt wird. Evertune analysiert die Darstellung von Marken in KI-Modellen und erstellt dank der hohen Geschwindigkeit des Modells schnell Berichte.
Erste Schritte mit dem Modell
Geben Sie zur Verwendung im Code „gemini-2.5-flash-lite“ an. Wenn Sie den Preview-Alias verwendet haben, wechseln Sie bis zum 25. August 2025 zur stabilen Version, da die Preview-Version dann entfernt wird. Das Modell ist in Google AI Studio und Vertex AI verfügbar. Laut einschlägigen Informationen aus dem Internet, etwa dem technischen Bericht von Google, eignet es sich ideal für Produktionsbereitstellungen mit hohem Durchsatz und niedrigen Kosten, wobei es Geschwindigkeit, Preis und Qualität in Einklang bringt.




