KI-Programmierassistenten stützen sich zunehmend auf Agentic Workflows. Sie können Repositorys überprüfen, Änderungen planen, Dateien bearbeiten, Tests durchführen und deren Ergebnisse auswerten sowie externe Tools aufrufen. Ein immer wichtigerer Bestandteil dieser Entwicklung ist der Einsatz von Agentic Skillsets. Das sind wiederverwendbare Anweisungspakete, die den Agenten vorgeben, wie sie Softwareentwicklungsaufgaben ausführen sollen.


Would you rather read the article in English?

Was Skillsets sind

Ein Skillset beschreibt, wie ein Agent seine Arbeit planen, Tests erstellen, Code überprüfen, Releases abwickeln oder Teamkonventionen befolgen sollte. In der Praxis liegen diese Anweisungen in der Regel in Form von Markdown-Dateien mit YAML-Metadaten vor (siehe Skills-Definitionen). Sie enthalten Beschreibungen von Aufgaben oder Arbeitsabläufen, Definitionen nützlicher Befehle oder Tools sowie Richtlinien, die darlegen, wie bestimmte Vorgänge durchzuführen sind. Manche bestehen ausschließlich aus Text. Andere können Skripte, Hooks oder sogar eine lokale Datenbank enthalten.

Skillsets verlagern einen Teil des Entwicklungsprozesses in den KI-Kontext. Teamregeln, Überprüfungsabläufe, Testgewohnheiten und architektonische Präferenzen werden zu Anweisungen, die ein Agent lesen und befolgen soll. Damit bilden Skill-Sets eine Brücke zwischen menschlicher Entwicklungsarbeit und KI-gestützter Umsetzung.

Agentic Workflows (Der Prozess):

Beschreibt den iterativen Gesamtablauf, in dem ein KI-Agent eine Aufgabe löst – von der Problemfall-Analyse über die Planung und Code-Anpassung bis hin zur Ausführung von Tests.


Agentic Skillsets (Das Regelwerk):

Wiederverwendbare, strukturierte Anweisungspakete (oft als Markdown/YAML), die dem Agenten innerhalb eines Workflows vorgeben, wie er eine spezifische Aufgabe (z.B. Code-Reviews oder Refactoring) nach Teamstandards ausführen soll, ohne dass eine Feinabstimmung des Modells erforderlich ist.


Function Calling (Die Schnittstelle):

Die technische Fähigkeit des unterliegenden Sprachmodells (LLM), externe Werkzeuge (z.B. Terminal, Git, Browser, Datenbanken) zu erkennen und anzusteuern.

Die meisten Skillsets steuern das Verhalten. So kann ein Skill einem Agenten beispielsweise befehlen, vor Abschluss einer Aufgabe Tests durchzuführen. Der Skill kann jedoch nicht garantieren, dass die richtigen Tests durchgeführt wurden, Fehler korrekt interpretiert wurden und der Agent keinen Schritt übersprungen hat.

Diese Unterscheidung ist wichtig. Ein Skillset ist weder ein CI-Gate, noch ein Typ-Checker, noch ein Berechtigungssystem, noch eine Regel zum Schutz von Versionierungsbranchen. Es gehört zur Steuerungsebene der Eingabeaufforderungen und des Kontexts. Diese Ebene kann nützlich sein. Sie ist jedoch nicht frei von Unsicherheiten.

Skillsets gibt es in verschiedenen Formen:

  • Einige bestehen ausschließlich aus Anweisungen und enthalten Markdown-Anleitungen, Checklisten sowie Beispiele.
  • Andere wiederum definieren Arbeitsabläufe für die Planung, Umsetzung, das Testen und die Überprüfung.
  • Einige bieten Anleitungen zur Nutzung von Tools wie Shell-Befehlen, Git, Browsern oder Paketmanagern.
  • Einige umfassen Infrastrukturkomponenten wie Skripte, lokale Dienste, Hooks oder Automatisierungsmaßnahmen rund um den Agenten.
  • Einige nutzen Multi-Agent-Muster und verteilen die Arbeit auf verschiedene Rollen wie Planer, Umsetzer, Prüfer, Tester oder Architekt.

Diese Formen überschneiden sich oft. Ein echtes Skillset kann Sofortanweisungen, Arbeitsabläufe, Skripte und rollenbasierte Orchestrierung kombinieren. Teams sollten daher nicht alle Skillsets gleich behandeln. Das Risiko hängt davon ab, was das Skillset auslösen und auf welche Daten der Agent zugreifen kann.

Ein Read-only-Chat-Assistent weist ein anderes Risikoprofil auf als ein Agent, der Dateien bearbeiten, Shell-Befehle ausführen, auf geheime Daten zugreifen, Browsersitzungen öffnen und Commits hochladen kann (siehe Docker-Horrorgeschichten). Bei sachgemäßer Nutzung können diese Fähigkeiten die KI-gestützte Entwicklung wiederholbarer, schneller und effizienter machen. Bei unbedachter Nutzung können jedoch neue Risiken in Bezug auf Sicherheit, Nachverfolgbarkeit, Kosten und übermäßiges Vertrauen in die Autonomie des Agenten entstehen. Die praktische Frage für Softwareteams lautet daher nicht, ob diese Fähigkeiten gut oder schlecht sind. Es geht vielmehr darum, wie sie bewertet und gesteuert werden.

Was Agentic Skillsets verbessern können

Skillsets können die Wiederholbarkeit verbessern. Ohne ein Skillset kann es vorkommen, dass ein Agent dieselbe Aufgabe in verschiedenen Sessions unterschiedlich angeht. Mit einem Skillset kann ein Team eine bevorzugte Vorgehensweise festlegen. Der Agent kann zunächst relevante Dateien prüfen, Tests identifizieren, einen Plan vorschlagen, eine kleine Änderung vornehmen, Überprüfungen durchführen und das Ergebnis zusammenfassen.

Aus gutem Grund gibt es Checklisten für Code-Reviews, Vorlagen für Releases, Architekturrichtlinien und Verfahren für Incident-Management. Mithilfe von Skillsets können einige dieser Routinen KI-Agenten zur Verfügung gestellt werden.

Zum Beispiel kann eine breit gefasste Bibliothek wie addyosmani-agent-skills einen Agenten daran erinnern, Tests, Dokumentation, Debugging und Reviews als Teil eines umfassenderen Engineering-Workflows zu berücksichtigen. Ein stärker fokussierter Skill im Stil von mattpocock-skills kann eine spezifischere Vorgehensweise festlegen, beispielsweise wie eine frameworkspezifische Refaktorisierung durchgeführt wird oder wie typsichere Codeänderungen strukturiert werden.

Dennoch ist Wiederholbarkeit nicht automatisch Korrektheit. Ein von Anfang bis Ende schlecht umgesetzter Workflow führt nach wie vor zu schlechten Ergebnissen. Teams müssen deshalb ihr Verhalten überprüfen und dürfen sich nicht nur mit der Struktur zufriedengeben.

Skillsets können auch die Zerlegung der Aufgaben verbessern. Viele Fehler von Agenten entstehen dadurch, dass die Aufgabe zu weit gefasst ist. Der Agent beginnt mit der Programmierung, bevor er das Problem vollständig verstanden hat. Er bearbeitet zu viele Dateien. Er verliert den Überblick über die Annahmen. Ein gutes Kompetenzprofil kann den Agenten im richtigen Moment bremsen. So kann es beispielsweise vor der Bearbeitung einen Plan verlangen, nach Risiken fragen, Kontrollpunkte erzwingen oder den Agenten anweisen, anzuhalten, wenn Anforderungen miteinander in Konflikt stehen.

An dieser Stelle werden präskriptive Systeme wie »Obra-Superpowers« interessant. Sie versuchen nicht nur, das Endergebnis, sondern auch den Arbeitsstil der Agenten zu beeinflussen. Sie können den Agenten dazu bringen, sich eher wie ein sorgfältiger Kooperationspartner zu verhalten. Das Risiko dabei ist jedoch, dass sich in solchen längeren autonomen Ketten kleine Fehler summieren können.

Skillsets können auch die Einarbeitung in Teamkonventionen unterstützen. Viele Teams haben Regeln, die in Dokumentationen, Kommentaren zu Code-Reviews oder in den Köpfen erfahrener Entwickelnder festgehalten sind. Ein Skillset kann dem Agenten mitteilen, welche Muster bevorzugt werden, welche Dateien geschützt sind, welche APIs veraltet sind und welche Dokumentation maßgeblich ist.

Das kann die Anzahl wiederholter Kommentare bei Reviews reduzieren. Zudem kann es implizites Wissen expliziter machen. Es sollte jedoch nicht die Begründung hinter den Regeln ersetzen. Nach Möglichkeit sollte ein Skillset auf anerkannte Dokumentation verweisen.

Vor allem aber wandeln Skillsets Prozesswissen in ein technisches Artefakt um. Sie sind teils Anweisung, teils Dokumentation, teils Workflow und manchmal auch Teil der Toolchain. Das bedeutet, dass sie kontrolliert, überprüft, versioniert und bei Veraltung gelöscht werden müssen.

Weiterbildung: Webinare zur sicheren Nutzung von LLMs

Wenn Sie sich für die praktische und zuverlässige Nutzung von LLMs interessieren, bietet das Team Data Science Webinare zu Large Language Models an, die sowohl kostenlos als auch kostenpflichtig sind.

Die Webinar-Reihe »Zuverlässiger Einsatz von Large Language Models (LLMs)« umfasst beispielsweise:

  1. Open Source LLMs selbst betreiben
  2. Retrieval Augmented Generation (RAG)
  3. Prompting Essentials—LLMs effektiv nutzen

Für Organisationen bieten wir auch maßgeschneiderte Seminare in deutscher und englischer Sprache an. Diese sind auf spezifische Ziele und Anwendungsbereiche zugeschnitten.

> Weitere Seminare

Wo Skillsets scheitern

Der Hauptfehler liegt auf der Hand: Anweisungen sind keine Kontrollmechanismen.

  • Ein Skillset kann beispielsweise vorschreiben: »Fehlerhafte Tests dürfen niemals festgeschrieben werden.« Das ist weniger wirksam als ein CI-Gate.
  • Ein Skillset kann vorschreiben: »Generierte Dateien dürfen nicht geändert werden.« Das ist weniger wirksam als ein Dateischutz.
  • Ein Skillset kann vorschreiben: »Es dürfen keine anfälligen Abhängigkeiten eingeführt werden.« Das ist weniger wirksam als das Scannen und Überprüfen von Abhängigkeiten.

Vergleich: Leitlinien vs. deterministische Kontrollen

Ebene (Typ)MechanismusFähigkeitenEinschränkungen
Agentic Skillsets (probabilistisch)Prompts, Checklisten, SKILL.mdund Workflows von UnteragentenLenken das Verhalten des Agenten, legen stilistische Präferenzen fest, verbessern die AufgabenzerlegungKönnen die Ausführung nicht garantieren, anfällig für Prompt-Injektion und Umgehungen
Technische Kontrollen (deterministisch)CI/CD-Pipelines, Zweigschutz, statische Analyse, TypprüferSetzen Regeln strikt durch, blockieren ungültigen Code, verhindern unbefugte CommitsEs fehlt an kontextbezogener Flexibilität, kann den Prozess des Codeschreibens nicht lenken

Das bedeutet jedoch nicht, dass Skillsets nutzlos sind. Vielmehr sollten Teams sie auf der richtigen Ebene einsetzen. Skillsets sollten zum Steuern des Verhaltens eingesetzt werden, während technische Kontrollmechanismen dazu dienen, wichtige Regeln durchzusetzen. Wenn eine Regel wichtig ist, sollte sie mit CI-Prüfungen, Branch-Schutz, Pre-Commit-Hooks, Berechtigungsgrenzen, Secret-Scanning oder menschlicher Freigabe untermauert werden.

Ein zweiter Fehlermodus ist der Overhead. Ein detaillierter, mehrstufiger Arbeitsablauf kann bei einer risikobehafteten Refaktorisierung hilfreich sein. Derselbe Arbeitsablauf kann jedoch eine kleine Korrektur in der Dokumentation verlangsamen. Multi-Agenten- oder rollenbasierte Systeme können viele Ressourcen für die Planung, Diskussion, Zusammenfassung und Erstellung von Zwischenprodukten aufwenden. Dies kann in manchen Fällen die Qualität verbessern, erhöht jedoch auch die Kosten und den Aufwand für die Überprüfung.

Dies gilt für Systeme wie obra-superpowers und gstack. Ihre Struktur kann bei größeren Aufgaben von Nutzen sein. Bei kleinen Änderungen können die Koordinationskosten jedoch den Nutzen überwiegen.

Ein dritter Fehlerfall ist das Lieferkettenrisiko. Ein Skillset mag wie eine Dokumentation aussehen, kann jedoch einen Agenten mit Zugriff auf leistungsstarke Tools beeinflussen. Eine Markdown-Anweisung kann einen Agenten dazu anweisen, Shell-Befehle auszuführen. Ein Skillset Repository kann Installationsskripte, Hooks, Binärdateien oder lokale Dienste enthalten. Ein Workflow kann den Agenten auffordern, Inhalte aus dem Netzwerk abzurufen oder mit Browsersitzungen zu interagieren.

Das ist wichtig, da KI-Agenten häufig in der Nähe von Quellcode, Berechtigungen, Build-Systemen, Issue-Trackern sowie internen Dokumentationen agieren. Selbst wenn es sich »nur um Text« handelt, kann ein böswilliger oder fahrlässiger Mitarbeiter Schaden anrichten. Dieses Risiko wächst, wenn ein Skillset (wie zum Beispiel gstack) spezifische Infrastruktur- und Runtime-Komponenten mit sich bringt..

Teams sollten vor der Installation Skillsets prüfen, Versionen festlegen und unbekannte Skillsets in einer Sandbox ausführen. Nach Möglichkeit sollte der Netzwerk- und Shell-Zugriff eingeschränkt werden. Externe Skillsets sollten wie Abhängigkeiten behandelt werden.

Eine vierte Fehlerquelle ist die Scheinkonformität. Agenten können Aufzeichnungen zu Architekturentscheidungen, Testpläne, Überprüfungsberichte, Risikobewertungen und Compliance-Vermerke erstellen. Diese Dokumente können offiziell wirken, auch wenn sie von keinem Experten geprüft wurden.

Das ist in sicherheitsrelevanten oder regulierten Bereichen besonders wichtig. Eine generierte Risikobewertung gilt erst dann als Nachweis, wenn sie von einer qualifizierten Person geprüft und genehmigt wurde. Teams benötigen eindeutige Kennzeichnungen für generierte Entwürfe, geschützte Speicherorte für verbindliche Dokumente und Genehmigungswege.

Ein fünfter Fehlerfall ist fehlendes Fachwissen. Ein Skillset kann zwar viele Regeln codieren, ist jedoch nicht in der Lage, alle Produktbeschränkungen, Sicherheitsziele, Bedrohungsmodelle, regulatorischen Verpflichtungen oder architektonischen Kompromisse zuverlässig abzuleiten. Gute Skillsets sollten daher Annahmeprotokolle, Klärungsfragen und Stoppbedingungen für Entscheidungen vorsehen, die Fachkompetenz erfordern.

Wie man Skillsets bewertet

Für Unternehmen ist nicht entscheidend, ob bestimmte Skillsets in einer Demo beeindruckend wirken. Vielmehr ist die Frage, ob sie unter realistischen Rahmenbedingungen zu besseren Entwicklungsergebnissen führen.

Viele Aussagen zu KI-Coding-Tools basieren auf Anekdoten, kurzen Demos, Sternen oder selbst gemeldeter Produktivität. Diese Signale sind zwar nützlich, reichen für fundierte Entscheidungen über die Einführung jedoch nicht aus. Teams benötigen Belege aus ihrem eigenen Kontext.

Eine nützliche Evaluation folgt einer strukturierten empirischen Vorgehensweise:

  • Schritt 1: Bounded Use Case definieren
    Ein Team könnte beispielsweise die Fähigkeiten in den Bereichen Testgenerierung, Code-Review, Abhängigkeitsupdates, Release Notes oder Migrationsplanung bewerten. Der Use Case sollte spezifisch genug sein, um messbar zu sein.
  • Schritt 2: Baseline festlegen
    Wie lange dauert die Aufgabe derzeit? Wie oft finden Reviews Probleme? Wie oft scheitert CI? Wie viel Nacharbeit ist erforderlich? Wie viel Aufsicht ist nötig?
  • Schritt 3: Multidimensionale Ergebnisse messen
    Die Bewertung sollte sich nicht nur auf die Geschwindigkeit konzentrieren. Eine schnellere Code-Entwicklung ist nicht hilfreich, wenn dadurch mehr Fehler, Review-Aufwand oder Sicherheitslücken entstehen. Nützliche Messgrößen sind unter anderem Zykluszeit, Implementierungszeit, Reviewzeit, CI-Fehler, Regressionsfehler, Code-Churn, Ergebnisse der statischen Analyse, unsichere Abhängigkeitsänderungen, Klärungsrunden, Überwachungszeit, Token-Kosten und Entwicklererfahrung.
  • Schritt 4: Prozesskonformität verifizieren
    Die Prozesskonformität ist ebenfalls wichtig. Wenn die Skillset-Anforderungen besagen, dass der Agent Tests ausführen sollte, dann überprüfen Sie, ob die Tests tatsächlich ausgeführt wurden. Wenn angegeben ist, dass der Agent Annahmen auflisten soll, überprüfen Sie, ob die Annahmen nützlich waren. Wenn die Anleitung besagt, dass der Agent sicherheitsrelevante Code-Pfade inspizieren soll, dann sollte überprüft werden, ob dies geschehen ist.

Es geht nicht darum, zu beweisen, dass ein bestimmtes Skillset universell besser ist. Vielmehr geht es darum, zu verstehen, welche Skillsets Teams bei welchen Aufgaben unter welchen Einschränkungen helfen.

Warum dies für zuverlässige KI wichtig ist

Skillsets liegen an der Schnittstelle mehrerer Bereiche. Sie sind Teil des Prompt-Engineerings, da sie das Modellverhalten durch Anweisungen formen. Sie sind Teil der Softwareentwicklung, da sie Entwicklungsprozesse codieren. Und sie sind Teil des Security Engineering, da sie Tools, Dateien, Abhängigkeiten und Berechtigungen beeinflussen können. Schließlich sind sie Teil der zuverlässigen KI, da sich Teams möglicherweise auf sie verlassen, um wiederholbares Verhalten zu erzielen.

Die Bewertung von Skillsets erfordert mehr als die Frage, ob ein Agent Code produziert hat. Es erfordert die Messung von Aufgabenoutcomes, die Überprüfung von Sicherheitsimplikationen, die Bewertung von menschlicher Aufsicht und das Verständnis von Fehlertoleranzen.

Das entscheidende Problem ist, dass Skillsets Teile des Entwicklungsprozesses in eine probabilistische Kontrollschicht verlagern. Diese Ebene kann die Konsistenz verbessern, aber sie kann keine deterministischen Schutzmaßnahmen ersetzen, wenn Fehler schwerwiegende Folgen haben.

Für die Industrie gilt die einfache Regel: Nutzen Sie Skillsets, um Agenten zu leiten, nutzen Sie Engineering-Kontrollen, um Systeme zu schützen, und nutzen Sie empirische Evaluationen, um zu entscheiden, ob sich die Skillsets lohnen.

Fazit: Agentic Workflows durch Skillsets und technische Kontrollen absichern

Agentic Workflows verändern das Software Engineering nachhaltig. Um diese Prozesse wiederholbar und konsistent zu gestalten, sind Skillsets ein wichtiger Schritt. Sie verwandeln Prompts in wiederverwendbare Prozessartefakte und verbessern das Onboarding, die Aufgabenaufteilung sowie die Überprüfungsdisziplin.

Aber sie sind kein Allheilmittel. Sie erzwingen kein Verhalten. Sie ersetzen auch nicht die Notwendigkeit von Fachwissen. Und sie können Supply-Chain-Risiken, Prozessüberlastung, falsche Nachverfolgbarkeit und übermäßiges Vertrauen in die Autonomie von Agenten verursachen.

Software-Teams sollten sie daher weder kategorisch ablehnen noch blind übernehmen. Sie sollten mit begrenzten Anwendungsfällen beginnen, Ergebnisse gegen eine Basislinie messen, Skillsets wie Abhängigkeiten untersuchen und technische Kontrollen verwenden, um Prompt-Level-Anweisungen zu untermauern, wenn Fehler schwerwiegende Folgen haben können.

Welche KI-Anwendungen sind richtig für Ihr Unternehmen?

Sie interessieren sich für KI und möchten wissen, ob sich diese für Ihr Unternehmen lohnt? Mit den  »AI Innovation Labs« haben wir eine Reihe von Methoden und Tools entwickelt, die es uns ermöglichen, AI-Anwendungen, die einen klaren geschäftlichen Mehrwert bieten, systematisch zu identifizieren, umzusetzen und zu bewerten.

Mehr über LLMs und generativer KI:

Referenzen


Verfasst von