Google hat in diese Woche den hauseigenen KI-Videogenerator mit einer neuen Version aktualisiert, die auf Gemini Omni 1.1 Flash hört und den Nutzern kreative neue Möglichkeiten gibt. Zu diesen gehört es, aus zwei einfachen Bildern ein Video zu erstellen oder auch mehrere mediale Objekte zu einem Video zusammenzufügen. In einigen Beispielen zeigt man, was damit möglich ist.
Mit dem KI-Videogenerator Gemini Omni 1.1 Flash lassen sich viele Dinge erstellen und bearbeiten, die lediglich auf einem einzelnen Prompt basieren. Dabei muss man sich aber nicht nur auf die Kreativität der KI verlassen, sondern kann diese auch selbst mit medialen Quellen und Objekten füttern, die im Video vorkommen sollen. Wir zeigen euch an zwei Beispielen, was damit möglich ist.
Video aus erstem und letztem Frame erstellen
Mit Gemini Omni 1.1 Flash lässt sich ein kontinuierliches Video zwischen zwei Schlüsselbildern erstellen, das von der KI selbst erdacht wird. Der Mediengenerator baut ein Video zwischen den beiden Bildern und schafft dadurch eine gemeinsame Welt. Auf Wunsch ist es dabei auch möglich, dass das Start- und Endbild identisch ist, sodass sich ein Video in Endlosschleife abspielen lässt.
Aufgabe 1: Eine Nahaufnahme aus der Froschperspektive zeigt einen eleganten Schlagzeuger im beigen Anzug, der in einem großen Saal ein rotes Schlagzeug spielt. Die Kamera schwenkt zur Seite und enthüllt einen älteren Saxophonisten, der neben einer Balletttänzerin in einem weißen Kostüm spielt, die sich unter sanftem violettem Bühnenlicht dreht. Eine einzige, ungeschnittene Einstellung.
Aufforderung 2: Die Kamera zoomt auf den Fernsehbildschirm, wo wir dieselbe Frau und dieselbe Szene wie zu Beginn sehen. Nahtloses Video. Eine einzige, ununterbrochene Einstellung, keine Schnitte.
Videoreferenzen
Beim Erstellen einer Szene lässt sich jetzt Referenzvideomaterial hochladen, das eine Länge von bis zu drei Sekunden haben kann. Dieses wird von der Gemini-KI verwendet und auf Wunsch und durch Eingabe des Prompts im neuen Video verwendet. Dadurch lässt sich der visuelle Kontext und die Konsistenz von Charakteren wahren. Im obigen Video sehr ihr Beispiele, die mit dem folgenden Prompt erstellt worden sind:
Aufgabe: Verwenden Sie die drei hochgeladenen Videos von Tänzern und ersetzen Sie diese durch die bereitgestellten Charaktere. Lassen Sie die Tänzer ihre individuellen Tänze aus den Referenzvideos gemeinsam in dem großen, offenen Raum des bereitgestellten Bildes aufführen.
Die Hundefigur dog.png soll den klassischen Tanz aus dance3.mp4 aufführen. Der Oktopus octo.png soll den Hip-Hop-Tanz aus dance1.mp4 tanzen, und der Bär bear.png soll den Breakdance aus dance2.mp4 tanzen. Das Endergebnis soll eine einzige, ungeschnittene Aufnahme sein.
Letzte Aktualisierung am 22.08.2026 / Bilder von der Amazon Product Advertising API / Affiliate Links, vielen Dank für eure Unterstützung! Als Amazon-Partner verdiene ich an qualifizierten Verkäufen.