Newsletter Subscribe
Enter your email address below and subscribe to our newsletter
[forminator_form id="25163"]

thenextweb+1thenextweb+1thenextweb+1Google Alphabet Inc. hat am Dienstag die Computernutzung als integriertes Tool in Gemini 3.5 Flash eingeführt. Dies ermöglicht es Entwicklern, KI-Agenten zu erstellen, die Bildschirme in Browser-, Mobil- und Desktop-Umgebungen sehen, analysieren und mit ihnen interagieren können. Die Funktion, die zuvor nur über das eigenständige Gemini 2.5-Modell für Computernutzung verfügbar war, ist nun nativ im Hauptmodell Flash eingebettet.thenextweb+1
Die Integration bedeutet, dass Entwickler kein separates, dediziertes Modell mehr aufrufen müssen, um Agenten zu erstellen, die mit grafischen Benutzeroberflächen interagieren. Stattdessen kann die Computernutzung als eines von mehreren Tools innerhalb von Flash aktiviert werden – neben Codeausführung, Suche und Funktionsaufrufen – über die Gemini API und die Gemini Enterprise Agent Platform, früher bekannt als Vertex AI.investing+1
Produktmanager Mateo Quiros beschrieb die Integration laut The Next Web als eine Möglichkeit, Flash die Fähigkeit zu geben, "Bildschirme zu sehen, zu analysieren und Aktionen auf ihnen auszuführen". Google erklärte, dass das Update die Leistung bei langfristigen und unternehmensweiten Automatisierungsaufgaben wie kontinuierlichen Softwaretests und wissensbasierten Arbeiten in professionellen Anwendungen verbessert.thenextweb+2
Um Sicherheitsrisiken für Agenten in Live-Umgebungen zu begegnen, hat Google gezieltes adversariales Training eingeführt, um Prompt-Injection-Angriffen entgegenzuwirken. Das Unternehmen bietet zudem zwei optionale Sicherheitsvorkehrungen für Unternehmen an: eine, die eine explizite Benutzerbestätigung erfordert, bevor der Agent sensible oder irreversible Aktionen ausführt, und eine weitere, die den Agenten automatisch stoppt, wenn er einen indirekten Prompt-Injection-Versuch erkennt.investing+1
Google stellt zusätzlich eine von Browserbase gehostete Demonstrationsumgebung bereit, damit Entwickler diese Funktionen testen können.investing
Gemini 3.5 Flash wurde erstmals am 19. Mai 2026 auf der Google I/O als Googles schnellstes agentisches KI-Modell veröffentlicht und lieferte laut Unternehmensangaben Spitzenleistung für Agenten- und Programmieraufgaben. Das Modell startete mit einem Eingabekontextfenster von einer Million Token und nativer Unterstützung für Funktionsaufrufe, strukturierte Ausgaben und Codeausführung, enthielt jedoch anfangs keine Computernutzung.simonwillison+3
Das Update vom 24. Juni, das im API-Changelog von Google als öffentliche Vorschau dokumentiert ist, schließt diese Lücke und positioniert Gemini 3.5 Flash als ein einzelnes Modell, das in der Lage ist, die gesamte Bandbreite agentischer Aufgaben zu bewältigen – von der Codegenerierung bis zur direkten Bildschirminteraktion –, ohne dass Entwickler mehrere Modelle koordinieren müssen.google