Google veröffentlicht Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking zur Verbesserung des KI-Dialogerlebnisses

·von Henderson·Gemini
Google veröffentlicht Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking zur Verbesserung des KI-Dialogerlebnisses

Google hat heute die Einführung von Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking angekündigt und bezeichnet sie als seine „modernsten Echtzeit-Dialogmodelle". Nach der Veröffentlichung von 3.1 Flash Live im März zielen diese neuen Modelle darauf ab, Gespräche mit künstlicher Intelligenz intuitiver und intelligenter zu gestalten. Wie der Name vermuten lässt, bietet Gemini 3.8 Live Extended Thinking „verbesserte Intelligenz und mehrstufiges Reasoning" für hochkomplexe Aufgaben, etwa für die kürzlich eingeführten Funktionen Gmail Live (konversationsbasierte Suche), Docs Live (Erstellung und Bearbeitung von Entwürfen) und Keep Live (Erstellung von Notizen).

Das Modell wird zudem auf Gemini Live ausgerollt, wobei 3.8 Live Extended Thinking in der Lage ist, „gleichzeitig zu reasoning und zu sprechen".

Das Modell liefert eine gesteigerte Intelligenz für komplexe Arbeitsabläufe und wahrt dabei einen kohärenten Gesprächsfluss. Es nutzt frühe verbale Hinweise wie „Lass mich das überprüfen …", um auf natürliche Weise auf Eingaben zu reagieren, und führt Nutzer mittels Echtzeit-Fortschrittserzählungen schrittweise durch mehrstufige Hintergrundaufgaben. Bei den Benchmarks „belegt es im menschlich bewerteten Voice-to-Voice-Qualitätsindex insgesamt den ersten Platz (82,6)"; „bei der Agent-Task-Completion-Rate liegt es mit 68,6 % vor τ-Voice"; „im Sierra-τ-Voice-Banking-Benchmark erreicht es 35,1 %"; „es verfügt über starke Reasoning-Fähigkeiten und erzielt im Big Bench Audio 97,7 %, während es im Vergleich zu anderen Frontier-Modellen zugleich einen wettbewerbsfähigen Preis bietet".

Gemini 3.8 Live bietet verbesserte Dialogintelligenz

Das Basismodell Gemini 3.8 Live bietet derweil „Dialogintelligenz mit flüssigen Gesprächen und visueller Verankerung". Das Modell kann nahezu in Echtzeit „visuelle Inputs" verarbeiten und während des laufenden Dialogs Tools sowie API-Aufrufe im Hintergrund ausführen. Nutzer können davon ausgehen, dass das Modell „auf Anfragen reagiert und das Gespräch fortsetzt", während Hintergrundaufgaben abgeschlossen werden. Darüber hinaus kann es im Dialog erkennen und zwischen 97 unterstützten Sprachen wechseln. Das Modell ist „auf Skalierbarkeit und Kosteneffizienz ausgelegt" und belegt in der „Voice Agent Arena den zweiten Platz".

Gemini 3.8 Live wird das Search-Live-Erlebnis im AI-Modus unterstützen.

H
Über den Autor
Henderson