Zum Inhalt

Über die Schulter geschaut: ein KI-Agent bei der Arbeit

Diese Seite ist zum Zuschauen, nicht zum Nachmachen. Sie zeigt einen einzigen Auftrag von Anfang bis Ende: 36 Minuten, 20 Nachfragen, zwei fertige Dateien. Gedacht ist sie für alle, die vor dem ersten eigenen Versuch wissen wollen, was da eigentlich passiert — und für alle, die Claude Code gar nicht selbst ausprobieren, aber verstehen möchten, worüber wir hier die ganze Zeit reden.

Nichts davon ist nachgestellt. Die Bilder stammen aus einem Testlauf vom 6. August 2026 auf einem frisch aufgesetzten Windows-Rechner, und sie sind in der Reihenfolge abgebildet, in der sie entstanden sind — inklusive der Stellen, an denen etwas schiefging.

Falls dir diese Seite jemand weitergeleitet hat: Was Claude Code überhaupt ist und wofür man es benutzt, steht in Stufe 3 · Was Claude Code wirklich ist. Zum Mitlesen hier braucht es das nicht — es macht die Bilder aber leichter einzuordnen.

Kernbotschaft

Ein KI-Agent ist kein Automat, der eine Taste drückt und ein Ergebnis ausspuckt. Er arbeitet in kleinen Schritten, fragt vor jedem davon nach, macht Fehler, merkt sie selbst — und korrigiert sich. Wer das einmal in Ruhe gesehen hat, weiß danach sehr genau, wo er selbst hinschauen muss.

Der Rahmen in fünf Zeilen

  • Aufgabe: eine Aufgaben-Checkliste als Excel-Datei und ein Zeitplan als Word-Datei für ein Team-Event mit acht Personen.
  • Rechner: frisch aufgesetztes Windows mit installiertem Office, ohne die Hilfsprogramme, nach denen Claude zuerst sucht.
  • Werkzeug: die Claude-Code-Desktop-App im Standardmodus „Manuell" — also: Es fragt vor jedem Befehl.
  • Dauer: 11:08 bis 11:44 Uhr, 20 Autorisierungsabfragen.
  • Ergebnis: zwei echte Office-Dateien. Das Format-Handwerk dahinter erklärt Stufe 3 · Word, Excel & Co.

11:08 — Bevor irgendetwas passiert: eine Vertrauensfrage

Der allererste Bildschirm ist kein Auftrag, sondern eine Rückfrage. Sobald man einen Ordner als Arbeitsbereich auswählt, will die App wissen, ob das so gemeint war:

Dialog der Desktop-App: „Diesem Workspace vertrauen? Claude Code kann Dateien in diesem Verzeichnis lesen, schreiben oder ausführen." mit dem Ordnerpfad und den Knöpfen „Abbrechen" und „Workspace vertrauen"
Der erste Dialog überhaupt: „Claude Code kann Dateien in diesem Verzeichnis lesen, schreiben oder ausführen. Fahre nur fort, wenn du diesem Workspace vertraust." Darunter steht der genaue Ordner — hier ein leerer Übungsordner.

Das ist mehr als eine Formalie: Genau hier entscheidest du, welchen Ausschnitt deines Rechners die KI überhaupt zu sehen bekommt. Alles Weitere spielt sich in diesem einen Ordner ab.

11:10 — Der Auftrag, in Alltagssprache

Dann der eigentliche Satz. Kein Fachjargon, keine Befehle, keine Einstellungen:

„Ich organisiere ein kleines Team-Event für acht Personen. Erstelle mir dazu eine Aufgaben-Checkliste (Was, Wer, bis wann) als Excel-Datei und einen groben Zeitplan als Word-Datei. Falls dafür Hilfsprogramme auf meinem Rechner fehlen (z.B. Python mit den nötigen Bibliotheken), richte sie selbst in einer eigenen, isolierten Umgebung ein - verändere nichts an meinen vorhandenen Programmen."

Bitte nicht herauskopieren. Das ist absichtlich ein anderer Auftrag als der, den wir empfehlen: unser erster Lauf, ganz ohne Vorgabe, wie Claude die Dateien bauen soll. Genau deshalb ist er der langsamere — und genau deshalb steht er hier, denn er zeigt, wie das Werkzeug sich selbst einen Weg sucht. Wenn du es selbst probierst, nimm den empfohlenen Auftrag mit der Methodenvorgabe aus Stufe 3 · Word, Excel & Co..

Und statt loszulegen, schaut Claude erst einmal nach, was auf diesem Rechner überhaupt vorhanden ist — und fragt schon dafür um Erlaubnis:

Die Desktop-App mit dem eingetippten Auftrag und darunter der Autorisierungsabfrage „Möchtest du Claude erlauben, ausführen Check for Python installation?" samt dem Befehl und den Knöpfen Ablehnen / Immer erlauben / Einmal erlauben
„Ich prüfe zuerst, was auf dem Rechner vorhanden ist." Die erste von zwanzig Nachfragen — und sie tut noch gar nichts, sie schaut nur nach.

Die ersten drei Nachfragen dienen ausschließlich dem Erkunden: Gibt es Python? Sind Word und Excel ansprechbar? Lassen sie sich testweise starten und sauber wieder beenden? Erst danach fasst Claude einen Plan.

11:18 — Der Plan kippt: „Dann nehme ich eben dein Office"

Das ist die interessanteste Stelle des ganzen Laufs. Der Auftrag hatte ausdrücklich angeboten, fehlende Hilfsprogramme selbst zu installieren. Claude entscheidet sich dagegen — weil es einen einfacheren Weg gefunden hat:

Claude Code meldet: „Python fehlt auf dem Rechner (nur der Microsoft-Store-Platzhalter), dafür sind Excel und Word 16.0 vorhanden und per Automatisierung ansprechbar." und kündigt an, die Dateien direkt mit dem vorhandenen Office zu erzeugen
„Damit brauche ich gar keine Installation und keinen Download — ich erzeuge die Dateien direkt mit deinem vorhandenen Office, ohne an dessen Einstellungen etwas zu ändern."

Kurz darauf steht die erste Arbeitsdatei: ein Hilfsskript von 432 Zeilen, das Claude sich selbst geschrieben hat. Wichtig für das Bauchgefühl: Diese Hilfsskripte landen nicht im Übungsordner, sondern in einem temporären Arbeitsbereich, den die App für diese eine Sitzung anlegt. Im Ordner sollen am Ende nur die beiden gewünschten Dateien liegen.

11:20–11:33 — Fehler, Diagnose, Korrektur

Ab hier läuft es nicht glatt, und genau deshalb steht dieser Abschnitt hier. Drei Beispiele in Folge:

  • Der erste Skriptlauf schlägt teilweise fehl: Sobald in einer Zelle Text stand, ließen sich die Zahlen danach nicht mehr sauber eintragen. Claude stellt daraufhin um, auf welchem Weg es die Werte überhaupt in die Tabelle schreibt.
  • Die Excel-Datei steht — aber eine Formatierungsregel fehlt. Claude sagt das von selbst an, statt es zu verschweigen.
  • Beim Nachbessern greift Regel 1, Regel 2 nicht. Claude stellt eine Vermutung auf, testet sie und behält recht:
Verlauf in der Desktop-App: „Excel-Datei steht (32 Aufgaben). Word läuft noch. Die bedingte Formatierung wurde übersprungen – die repariere ich nach" und „Regel 1 sitzt, Regel 2 scheitert – vermutlich an der Formelsprache (deutsche Excel-Oberfläche). Ich teste die Varianten"
Fehlersuche im Klartext: „vermutlich an der Formelsprache (deutsche Excel-Oberfläche)". Ein paar Zeilen später steht die Auflösung: „Beide Regeln greifen (deutsche Formelsprache war der Punkt)."

Übersetzt heißt das: Ein deutsches Excel erwartet in Formeln deutsche Funktionsnamen. Hier sind es drei Nachfragen und zwei Minuten — aber eben nicht null.

11:34–11:36 — Word hängt, und es wird kurz heikel

Dann bleibt Word stecken. Auch das meldet Claude von selbst:

Claude Code meldet „Word hängt (CPU läuft, keine Datei). Ich stoppe den Lauf und grenze die Ursache ein" und fragt die Erlaubnis für einen Prüfbefehl an
„Word hängt (CPU läuft, keine Datei). Ich stoppe den Lauf und grenze die Ursache ein."

Die nächste Nachfrage haben wir genau angeschaut — denn hier will Claude Programme beenden:

Autorisierungsabfrage „Terminate orphaned hidden Office automation instances" mit dem sichtbaren Befehl, der nur fensterlose Word- und Excel-Prozesse beendet
Der heikelste Moment: Claude will Word- und Excel-Prozesse abschießen. Im Befehl steht die entscheidende Einschränkung — betroffen sind nur die unsichtbaren Hintergrund-Instanzen, die es selbst gestartet hat. Ein geöffnetes Word-Dokument bleibt unberührt.

Genau für solche Momente sind diese Nachfragen da. Man kann sie in zwei Sekunden wegklicken — oder eben lesen. Was dahintersteckt und wie man das Dauerklicken später sinnvoll reduziert, ohne die Kontrolle zu verlieren, steht in Stufe 4 · Rechte & Auto-Modus — diese Stufe erscheint demnächst.

Ehrlich dazugesagt: Lesen heißt nicht verstehen. Die Überschrift dieser Nachfrage kam auf Englisch und in Technikersprache — „Terminate orphaned hidden Office automation instances" —, und das Hilfsskript von vorhin hat 432 Zeilen; die liest im Lauf niemand Zeile für Zeile durch. Als Nicht-Techniker beurteilst du solche Befehle realistisch nicht. Was du beurteilen kannst, ist der Satz, den Claude vorher in normalem Deutsch dazu schreibt („Word hängt … ich stoppe den Lauf"), und ob er zu dem passt, was du beauftragt hast. Und wenn dir das nicht reicht, gilt der Griff aus Stufe 3 · Word, Excel & Co.: ablehnen und fragen. Claude hält dann genau an dieser Stelle an, und du kannst tippen: „Was hattest du gerade vor, was bedeutet das, und warum machst du das?" Ergibt die Antwort Sinn, erlaubst du es nachträglich; wenn nicht, bittest du um einen anderen Weg. Ablehnen kostet dich nichts außer einer Frage — das ist auch ein Unterschied zu einem Programm, das einfach durchläuft.

11:37–11:42 — Es prüft sich selbst

Nachdem beide Dateien existieren, passiert etwas, das wir nicht verlangt hatten: Claude liest sein eigenes Ergebnis noch einmal ein und kontrolliert es.

Claude Code meldet „Beide Dateien sind erzeugt. Jetzt prüfe ich sie inhaltlich nach — inklusive korrekter Umlaute, Datumsformate und Regeln" und fragt die Erlaubnis für das Prüfskript an
Selbstkontrolle ohne Aufforderung: „Jetzt prüfe ich sie inhaltlich nach — inklusive korrekter Umlaute, Datumsformate und Regeln."

Die Prüfung findet zwei Mängel: ein Datumsformat, das das deutsche Excel anders interpretiert, und Aufzählungspunkte in Word, die nicht gesetzt wurden. Beides bessert Claude nach — und danach noch ein drittes Detail, einen Einzug, der nicht gegriffen hat.

Zum Schluss will es sich das Ergebnis sogar ansehen: Es exportiert beide Dateien testweise als PDF, um sie optisch zu prüfen — und stößt an eine Grenze, die es offen benennt: „PDF-Rendering steht hier nicht zur Verfügung — inhaltlich ist aber alles programmatisch geprüft." Das Werkzeug sagt also auch, was es nicht überprüfen konnte. Dann räumt es die Hilfsdateien weg.

11:44 — Das Ergebnis

Abschlussbericht in der Desktop-App: zwei Datei-Kacheln, Auflistung des Inhalts beider Dateien und die Feststellung, dass nichts installiert und keine Einstellung verändert wurde
Der Abschlussbericht nach 36 Minuten: was in den Dateien steckt, was Claude dafür getan hat — und was es ausdrücklich nicht getan hat.

Im Ordner liegen jetzt eine Excel-Datei mit 32 Aufgaben in sechs Phasen (mit Auswahlliste für den Status, Farblogik für erledigte und überfällige Zeilen, fixierter Kopfzeile, Filter und einem zweiten Blatt für die Eckdaten) und ein zweiseitiges Word-Dokument mit Zeitplan, Ablauf des Event-Tags und Plan-B-Hinweisen.

Die beiden Dateien aus diesem Lauf

Hier kannst du genau das herunterladen, was in diesen 36 Minuten entstanden ist — unverändert, so wie Claude Code es abgelegt hat:

Wichtig für den Zahlenvergleich: 32 Aufgaben und zwei Word-Seiten sind die Zahlen dieses Laufs. In Stufe 3 · Word, Excel & Co. ist von 22 Aufgaben und einem dreiseitigen Zeitplan die Rede — das ist der zweite, schnellere Lauf mit dem anderen Auftrag, und dort stehen auch dessen Dateien zum Download. Derselbe Auftrag, zwei Läufe, zwei verschiedene Ergebnisse: Genau so verhalten sich LLMs.

Zwei Absätze des Berichts verdienen besondere Beachtung. Der eine ist die Bilanz zur Technik: „Es wurde nichts installiert, nichts heruntergeladen und keine Einstellung an Excel oder Word verändert; die Hintergrund-Instanzen sind beendet." Der andere heißt „Annahmen, die du anpassen solltest" — Claude legt offen, dass es das Eventdatum gesetzt und statt Namen Rollen eingetragen hat, weil wir beides nicht mitgeliefert hatten.

Was man daraus mitnehmen kann

  1. Nichts passiert heimlich. Zwanzig Nachfragen in 36 Minuten — vom ersten Blick in den Ordner bis zum letzten Aufräumschritt. Auch reines Nachschauen fragt.
  2. Fehler sind der Normalfall, nicht das Scheitern. Zähl oben mit: sieben Stellen, an denen etwas nicht funktionierte — vom ersten Skriptlauf über das hängende Word bis zum Einzug in der Word-Aufzählung. Alle hat das Werkzeug selbst entdeckt und gelöst.
  3. Es erklärt sich, während es arbeitet. Fast jeder Schritt kommt mit einem Satz Begründung in normalem Deutsch. Man muss den Befehl darunter nicht verstehen, um zu verstehen, was gerade vorgeht.
  4. Es kennt seine Grenzen. „PDF-Rendering steht hier nicht zur Verfügung" ist eine ehrliche Auskunft. Sie sagt dir, wo du selbst hinschauen musst.
  5. Am Ende stehen Annahmen, keine Wahrheiten. Datum, Namen, Budget wurde alles vorläufig eingetragen. Willst du Details präzisiert haben, kannst du das jetzt direkt in den Dateien machen oder von Claude erledigen lassen. Das Ergebnis ist ein Entwurf, kein fertiges Dokument.

Zum Nachdenken

Stell dir vor, ein neuer Kollege hätte dir diese 36 Minuten so vorgeführt — mit allen Umwegen, allen Selbstkorrekturen und der offenen Liste seiner Annahmen. Würdest du ihm beim nächsten Mal über die Schulter schauen, oder würdest du ihn machen lassen? Und woran genau würdest du diese Entscheidung festmachen?


Weiterlesen: Wie du dieselbe Aufgabe selbst stellst — mit dem empfohlenen Auftrag —, steht in Stufe 3 · Word, Excel & Co.; dort findest du auch die Dateien des zweiten Laufs. Die Dateien dieses Protokolls liegen weiter oben im Kasten „Die beiden Dateien aus diesem Lauf". Warum die Verantwortung für so ein Ergebnis trotzdem bei dir bleibt, klärt Stufe 3 · Machen lassen & Verantwortung tragen.