Definition: Computer Use (KI-Agent)
Computer Use ist die Fähigkeit eines KI-Agenten, die grafische Oberfläche eines Computers direkt zu bedienen, den Bildschirm über Screenshots zu erfassen und Mausklicks sowie Tastatureingaben auszuführen, statt eine vordefinierte Softwareschnittstelle aufzurufen.
Kernmerkmale von Computer Use
Ein Computer-Use-Agent nimmt einen Bildschirm so wahr wie ein Mensch und handelt genauso darauf, ohne dass vorab eine Integration gebaut werden muss. Er wechselt fortlaufend zwischen Beobachten, Entscheiden und Handeln, bis die Aufgabe erledigt ist.
- Erfasst die Oberfläche über Screenshots, nicht über Code oder Datenbankeinträge
- Führt native Eingaben aus: Mausbewegung, Klicks, Tastatureingaben, Scrollen
- Funktioniert in Browsern, Desktop-Anwendungen und Alt-Oberflächen ohne eigenen Konnektor
- Wechselt automatisch zu Tool Calling, sobald für einen Teilschritt eine saubere API existiert
Computer Use vs. RPA
Klassische RPA-Bots klicken und tippen ebenfalls durch eine Oberfläche, folgen dabei aber Skripten mit festen Koordinaten oder UI-Element-IDs und brechen ab, sobald ein Anbieter einen Button verschiebt. Ein Computer-Use-Agent interpretiert stattdessen jeden Screenshot mit einem Vision-Language-Modell, ähnlich wie ein Mensch, und passt sich an veränderte Bildschirme an, an denen ein starres RPA-Skript scheitern würde. RPA bleibt auf einer unveränderten Oberfläche schneller und deterministisch; Computer Use tauscht einen Teil dieser Sicherheit gegen Reichweite ein.
Bedeutung von Computer Use im Enterprise-KI-Umfeld
Ein Großteil der Unternehmenssoftware, insbesondere ältere ERP-Module, Lieferantenportale und Behördensysteme, wurde nie mit Blick auf Automatisierung gebaut. Im OSWorld-Benchmark von Anthropic lösen führende Modelle rund 60-65 % realistischer Desktop-Aufgaben vollständig, ein menschlicher Vergleichswert liegt bei etwa 72-75 %, wobei sich der Abstand mit jeder Modellgeneration verringert.
Methoden und Verfahren für Computer Use
Ein zuverlässiger Computer-Use-Agent kombiniert eine überschaubare Anzahl etablierter Techniken.
Vision-Language-Grounding
Der Agent erstellt bei jedem Schritt einen Screenshot und nutzt ein Computer-Vision- und Sprachmodell, um die relevanten Schaltflächen und Felder zu lokalisieren, und überträgt dieses Verständnis auf Koordinaten, auf denen er handeln kann.
- Screenshot vor und nach jeder Aktion
- Erkennung von Elementen und Koordinaten für den nächsten Klick oder das nächste Feld
- Auswahl der Aktion, geprüft gegen den übergeordneten Aufgabenplan
Aktions-Wahrnehmungs-Schleife
Statt ein langes, festes Skript abzuarbeiten, durchläuft der Agent eine enge Schleife aus Handeln, Beobachten des resultierenden Bildschirms und Prüfen des Ergebnisses vor dem nächsten Schritt. Landet ein Klick falsch oder lädt eine Seite nicht wie erwartet, wertet der Agent den Screenshot neu aus und versucht es erneut, statt blind weiterzumachen.
Abgesicherte Ausführung
Produktive Einsätze lassen den Agenten in einer isolierten Sitzung mit eingeschränkten Zugangsdaten laufen und pausieren vor Zahlungen, Löschungen oder ausgehenden Nachrichten für eine menschliche Freigabe, dieselbe Disziplin, die Unternehmen bereits über KI-Leitplanken für jeden Agenten mit echten Handlungsbefugnissen anwenden.
Wichtige Kennzahlen für Computer Use
Die Messung von Computer Use erfordert Kennzahlen, die speziell auf Wahrnehmung und Handlung des Agenten zugeschnitten sind.
Operative Effizienz-Kennzahlen
- Erfolgsquote: 60-75 % bei unbekannten Bildschirmaufgaben für aktuelle Modelle
- Latenz Screenshot zu Aktion: 2-5 Sekunden pro Schritt
- Wiederholungsquote: unter 15 % der Schritte je abgeschlossener Aufgabe
Strategische Geschäftskennzahlen
Der geschäftliche Nutzen hängt davon ab, welche manuelle, bildschirmbasierte Arbeit aus der Warteschlange eines Teams verschwindet. Gartner geht davon aus, dass bis 2026 40 % der Unternehmensanwendungen eingebettete, aufgabenspezifische Agenten enthalten werden, gegenüber unter 5 % im Jahr 2025.
Qualitäts- und Genauigkeitskennzahlen
Ein gut abgestimmter Agent hält Fehlklick-Raten im niedrigen einstelligen Bereich, mit einer klaren Trennung zwischen einem echten, gemeldeten Fehlschlag und einem falschen Erfolg, bei dem der Agent Erfolg meldet, obwohl die Aktion nicht angekommen ist.
Risikofaktoren und Kontrollen bei Computer Use
Weil ein Computer-Use-Agent über dieselbe Oberfläche handelt wie ein Mensch, ähneln seine Risiken eher einem überprivilegierten Mitarbeiterkonto als einer klassischen API-Integration.
Bildschirmmanipulation und Prompt Injection
Ein bösartiges Pop-up, versteckter Text auf einer Seite oder ein gefälschtes Dialogfenster können den Agenten zu einer ungewollten Aktion verleiten, da er alles, was auf dem Bildschirm erscheint, als mögliche Anweisung liest.
- Nicht vertrauenswürdige Pop-ups, die als Systemmeldung erscheinen
- Versteckter oder außerhalb des sichtbaren Bereichs liegender Text auf einer Seite
- Nachgeahmte Bestätigungsdialoge, die einen ungewollten Klick auslösen sollen
Breiter, ungezielter Zugriff
Ein angemeldeter Computer-Use-Agent hat meist denselben Zugriff wie das menschliche Konto, unter dem er läuft, weshalb Zugangsbeschränkung und Sitzungsisolierung hier ebenso wichtig sind wie an anderer Stelle im System.
Irreversible oder teure Aktionen
Ein einzelner Fehlklick kann eine E-Mail versenden oder eine Zahlung auslösen, bevor jemand sie prüft. Unternehmen begegnen dem mit einer gestuften Autonomiestufe und menschlicher Aufsicht für folgenreiche Aktionen.
Praxisbeispiel
Ein 90 Mitarbeiter zählendes Speditionsunternehmen in Bremen musste täglich den Status von Sendungen in mehreren Zoll- und Reederei-Portalen prüfen, von denen keines eine API bereitstellt. Zuvor loggten sich Disponenten nacheinander in jedes Portal ein und übertrugen die Ergebnisse manuell in eine Sammeltabelle. Ein KI-Agent übernimmt diese Bildschirm-für-Bildschirm-Prüfung nun jeden Morgen über eine gespeicherte, eingeschränkte Sitzung und meldet auffällige Sendungen automatisch an einen Disponenten.
- Tägliche automatisierte Statusprüfung über alle angebundenen Portale
- Screenshot-basierte Bestätigung, dass sich ein Sendungsstatus tatsächlich geändert hat
- Konsolidierter Bericht mit Ausnahmen, die an einen benannten Prüfer gehen
- Weiterbetrieb auch nach kleineren Portal-Umstellungen
Aktuelle Entwicklungen und Auswirkungen
Computer Use entwickelt sich rasch von einer Forschungs-Demo zu einer produktiven Fähigkeit mit eigenen Benchmarks und Schutzmechanismen.
Benchmark- und Zuverlässigkeits-Wettlauf
Anbieter veröffentlichen zunehmend Ergebnisse auf gemeinsamen Tests wie OSWorld und WebArena, wodurch Fortschritte zwischen Modellen vergleichbar werden.
- Erfolgsquoten bei mehrstufigen Aufgaben steigen mit jeder Modellgeneration
- Der Abstand zur menschlichen Erfolgsquote verringert sich, ist aber nicht geschlossen
- Die Genauigkeit beim Erkennen von Bildschirmelementen bleibt der größte Engpass
Von begleiteten Sitzungen zu unbeaufsichtigten Läufen
Frühe Einsätze ließen einen Menschen jede Aktion beobachten; neuere Systeme lassen einen Agenten eine Aufgabenliste unbeaufsichtigt abarbeiten, während ein Mensch anschließend nur noch eine Zusammenfassung prüft.
Konvergenz mit API-basierter Integration
Unternehmen behandeln Computer Use zunehmend als Rückfalloption für Systeme, die wirklich keine API haben, während Model Context Protocol-Verbindungen alles übernehmen, was eine API bereitstellt. Superkinds KI-Mitarbeiter folgen demselben Muster: API-Zugriff, wo verfügbar, und Computer Use für die Portale und Desktop-Tools, die keine haben.
Fazit
Computer Use schließt die Lücke zwischen dem, was ein KI-Agent über eine saubere API erreicht, und dem, was ein Mitarbeiter tatsächlich auf dem Bildschirm sieht und tut. Das zählt besonders für Behördenportale und alternde ERP-Module, die den Arbeitsalltag im Mittelstand prägen und nie eine moderne API bekommen werden. Mit steigender Benchmark-Genauigkeit und reifenden Schutzmechanismen wird Computer Use zu einem festen Bestandteil des Automatisierungs-Werkzeugkastens statt einer Neuheit. Ausgerechnet die Systeme, die sich der Automatisierung am längsten widersetzt haben, erreicht dieser Ansatz heute am besten.
Häufig gestellte Fragen
Was bedeutet Computer Use bei einem KI-Agenten?
Computer Use bedeutet, dass der Agent die grafische Oberfläche eines Computers direkt bedient, Screenshots betrachtet und wie ein Mensch klickt und tippt. So funktioniert er in jeder Anwendung, die er sehen kann, auch ohne API.
Wie unterscheidet sich Computer Use von RPA?
RPA-Bots folgen Skripten mit festen Bildschirmkoordinaten und brechen ab, wenn sich eine Oberfläche ändert. Ein Computer-Use-Agent interpretiert jeden Screenshot mit einem Vision-Language-Modell und passt sich an veränderte Oberflächen an, an denen ein starres RPA-Skript scheitern würde.
Ist Computer Use sicher genug für die EU-KI-Verordnung und sensible Systeme?
Ja, sofern der Einsatz eingeschränkte Zugangsdaten, eine isolierte Sitzung, menschliche Freigaben bei folgenreichen Aktionen und eine vollständige Protokollierung umfasst. So umgesetzt erfüllt er die Anforderungen an menschliche Aufsicht und Transparenz, die die EU-KI-Verordnung an automatisierte Entscheidungen stellt.
Braucht ein Mittelstandsunternehmen ein eigenes IT-Team für einen Computer-Use-Agenten?
Nein, ein eigenes internes KI-Team ist nicht erforderlich. Die meisten mittelständischen Unternehmen arbeiten für die Ersteinrichtung mit einem Umsetzungspartner zusammen, während interne Mitarbeiter festlegen, welche Bildschirme und Aufgaben der Agent übernehmen soll.
Was kostet ein Computer-Use-Projekt und wie lange dauert die Einführung?
Eine fokussierte Einführung für ein oder zwei wiederkehrende Arbeitsabläufe dauert von der Konzeption bis zum Produktivbetrieb meist 6 bis 10 Wochen. Die Kosten hängen vor allem von der Anzahl der angebundenen Systeme und dem Freigabeprozess für sensible Aktionen ab, nicht vom zugrunde liegenden Modell.
Lohnt sich Computer Use auch für ein kleineres Unternehmen mit nur wenigen Altsystemen?
Ja, oft sogar mehr als für einen Großkonzern, weil kleinere Teams selten Budget für eine eigene Integration in jedes alte Werkzeug haben. Computer Use lässt einen Agenten genau diese Systeme erreichen, ohne für jedes ein eigenes Integrationsprojekt zu starten.