
Der jährliche Penetrationstest ist ein Erbe einer Zeit, in der sich Angriffsflächen langsam veränderten. Diese Zeit ist vorbei. Das BSI zählte im Berichtszeitraum 2024/2025 durchschnittlich 119 neue Schwachstellen pro Tag, ein Plus von 24 Prozent gegenüber dem Vorjahr. Ein Testzyklus, der zwölf Monate umfasst, prüft am Ende einen Zustand, den es nicht mehr gibt.
Zwei Antworten haben sich herausgebildet: eine regulatorische im Finanzsektor mit dem bedrohungsgeleiteten Penetrationstest nach DORA und eine operative in der breiten Wirtschaft mit Continuous Threat Exposure Management. Dieser Beitrag ordnet beide ein, trennt die Testarten sauber voneinander und benennt, was CTEM leisten kann und was nicht.
Dieser Beitrag richtet sich an CISOs und Sicherheitsverantwortliche in Konzernen und großen Mittelstandsunternehmen, Leitungen von Security Assurance und Schwachstellenmanagement, Compliance- und Auslagerungsverantwortliche in Banken, Versicherungen und Zahlungsdienstleistern sowie IT-Architektinnen und -Architekten mit Verantwortung für exponierte Systeme. Sie erfahren, wer nach DORA testpflichtig ist und wie der Prozess abläuft, wie sich Penetrationstest, Red Teaming, Purple Teaming, Adversary Emulation, Breach and Attack Simulation und TLPT tatsächlich unterscheiden, welche Anforderungen DORA an Tester stellt und wie sich ein CTEM-Programm gegen bestehendes Schwachstellenmanagement abgrenzt.
Weil die Zahlen zeigen, dass die Lücke zwischen Exposition und Behebung wächst. Der Verizon Data Breach Investigations Report 2026 stellt fest, dass die Ausnutzung von Schwachstellen mit 31 Prozent der Erstzugriffe erstmals an der Spitze steht. Das ist ein Anstieg von 55 Prozent gegenüber dem Vorjahreswert von 20 Prozent. Gleichzeitig stieg die mediane Behebungszeit für Schwachstellen aus dem Katalog bekannt ausgenutzter Schwachstellen von 32 auf 43 Tage und nur 26 Prozent dieser Schwachstellen werden vollständig behoben, nach 38 Prozent im Vorjahr.
Der Report formuliert einen Befund, der jede Reifegraddiskussion relativiert: Auch eine Woche nach Bekanntwerden sind zwischen 60 und 70 Prozent der bekannt ausgenutzten Schwachstellen noch offen, weitgehend unabhängig von Reifegrad, Investitionshöhe und Werkzeugausstattung.
DORA definiert TLPT in Artikel 3 Nummer 17 als Rahmen, der die Taktiken, Techniken und Vorgehensweisen realer Bedrohungsakteure nachbildet, die als echte Cyberbedrohung wahrgenommen werden. Die BaFin verwendet dafür die deutsche Bezeichnung „bedrohungsgeleitete Penetrationstests".
Die Pflicht ergibt sich aus Artikel 26 der Verordnung (EU) 2022/2554: Betroffene Finanzunternehmen führen mindestens alle drei Jahre erweiterte Tests mittels TLPT durch. Die Tests decken kritische oder wichtige Funktionen ab und laufen auf Live-Produktionssystemen. Sind IKT-Drittdienstleister eingebunden, muss das Finanzunternehmen deren Teilnahme sicherstellen – die Verantwortung bleibt beim Institut. Nach Abschluss stellt die Behörde eine Attestierung aus, die die gegenseitige Anerkennung innerhalb der EU ermöglicht.
Wer testpflichtig ist, entscheidet nicht das Unternehmen selbst. In Deutschland identifizieren BaFin beziehungsweise die EZB für bedeutende Institute die verpflichteten Unternehmen und benachrichtigen sie per Bescheid. Kriterien sind die Auswirkung auf den Finanzsektor, Systemrelevanz und das IKT-Risikoprofil. Die Delegierte Verordnung (EU) 2025/1190 der Kommission vom 13. Februar 2025 konkretisiert diese Kriterien; sie wurde am 18. Juni 2025 im Amtsblatt veröffentlicht und trat am 8. Juli 2025 in Kraft.
„identified financial entities must carry out, at least every three years, advanced operational resilience testing by means of threat-led penetration testing (TLPT)." Europäische Zentralbank, TIBER-EU SSM Implementation Guide, 2025
TIBER-EU ist das Rahmenwerk der Europäischen Zentralbank für nachrichtendienstlich geleitetes Red Teaming, erstmals im Mai 2018 veröffentlicht, in der aktuellen Fassung von Januar 2025 an DORA und den TLPT-Regulierungsstandard angeglichen. Die EZB beschreibt das Verhältnis der beiden Regelwerke präzise:
„DORA and the RTS on TLPT set out precise but high-level legal requirements on what needs to be done or achieved during a test (the 'what'). The TIBER-EU framework […] is a detailed, non-legally binding explanation and operationalisation of how TLPT should be conducted." Europäische Zentralbank, TIBER-EU SSM Implementation Guide, 2025
Der Prozess gliedert sich in drei Phasen:
Die Rollen sind im Rahmenwerk klar benannt: das Control Team auf Seiten des getesteten Unternehmens, das nicht eingeweihte Blue Team, die externen Red Team Testers, der externe Threat Intelligence Provider sowie das TIBER Cyber Team bei der Behörde mit einem Test Manager.
In Deutschland setzt die Deutsche Bundesbank das Rahmenwerk als TIBER-DE um; das aktuelle Implementierungsdokument liegt in Version 4.0 von Juli 2025 vor. Wichtig für die Einordnung: TIBER-DE-Tests sind freiwillig, TLPT nach DORA ist verpflichtend. Operativ stützen sich beide auf TIBER-EU. Zuständige Aufsichtsbehörde ist die BaFin, die operative Begleitung übernimmt die Bundesbank.
Artikel 27 DORA stellt fünf Anforderungen an externe Tester. Sie müssen von höchster Eignung und Reputation sein, technische und organisatorische Fähigkeiten sowie nachgewiesene Expertise in Threat Intelligence, Penetrationstests und Red-Team-Testing besitzen, von einer Akkreditierungsstelle in einem Mitgliedstaat zertifiziert sein oder formalen Verhaltenskodizes folgen, eine unabhängige Zusicherung oder einen Prüfbericht zum soliden Risikomanagement vorlegen und über eine angemessene Berufshaftpflichtversicherung verfügen.
Interne Tester sind nur mit Genehmigung der zuständigen Behörde und bei nachgewiesen ausreichenden dedizierten Ressourcen zulässig. Die Bedrohungsanalyse dagegen darf ein Institut nicht im eigenen Haus erstellen. Der Threat-Intelligence-Anbieter muss extern sein: Die Delegierte Verordnung (EU) 2025/1190 definiert ihn als extern gegenüber dem Finanzunternehmen und dessen gruppeninternen IKT-Dienstleistern. Kommen interne Tester zum Einsatz, schreibt Artikel 27 Absatz 2 DORA den externen Anbieter zusätzlich ausdrücklich vor. In Ausschreibungen wird dieser Punkt regelmäßig übersehen.
Die Begriffe werden im Markt häufig synonym verwendet, obwohl sie unterschiedliche Fragen beantworten.
Testart | Leitfrage | Belegte Definition / Quelle |
Penetrationstest | Welche Schwachstellen hat dieses System? | „Security testing in which evaluators mimic real-world attacks in an attempt to identify ways to circumvent security features." (NIST SP 800-115) |
Red Teaming | Erkennt und stoppt uns unsere eigene Verteidigung? | „A group of people authorized and organized to emulate a potential adversary's attack or exploitation capabilities against an enterprise's security posture." (CNSSI 4009-2015) |
Adversary Emulation | Halten wir gegen diesen konkreten Akteur stand? | ATT&CK „provides a common language and framework that red teams can use to emulate specific threats." (MITRE) |
Purple Teaming | Wie verbessern wir Detektion gemeinsam? | Von der EZB als eigene Praxis dokumentiert, in TIBER-EU in der Abschlussphase verankert |
TLPT | Bestehen wir eine aufsichtlich begleitete Prüfung auf Produktion? | „a framework that mimics the tactics, techniques and procedures of real-life threat actors" (Art. 3 Nr. 17 DORA) |
Breach and Attack Simulation | Funktionieren unsere Kontrollen heute noch? | Automatisierte, kontinuierliche Wiederholung bekannter Angriffstechniken; kein Standardisierungsgremium |
CTEM | Priorisieren wir das Richtige? | Betriebsmodell, das die übrigen Verfahren orchestriert; Ursprung Gartner-Research |
Die entscheidende Trennung verläuft nicht zwischen den Werkzeugen, sondern zwischen den Prüfgegenständen. Ein Penetrationstest prüft Systeme. Red Teaming und TLPT prüfen die Organisation, einschließlich der Frage, ob das Security Operations Center den Angriff bemerkt und ob die Eskalationskette funktioniert. Wer nach einem Red-Team-Test feststellt, dass niemand etwas gemerkt hat, hat kein Testergebnis, sondern einen Befund über die eigene Erkennungsfähigkeit. Wie sich diese Fähigkeit systematisch aufbauen lässt, behandelt der Beitrag zum hochautomatisierten Cyber SOC.
Als methodische Grundlage für Emulationen hat sich MITRE ATT&CK etabliert; Version 19 erschien am 28. April 2026, die aktuelle Fassung 19.2 am 6. August 2026. In den ATT&CK Evaluations der Enterprise-Runde 2025, deren Ergebnisse am 10. Dezember 2025 erschienen, wurden Scattered Spider und Mustang Panda emuliert, erstmals einschließlich Cloud-Angriffsszenarien.
CTEM geht auf Gartner-Research aus dem Jahr 2022 zurück und beschreibt einen fortlaufenden Zyklus aus fünf Phasen:
„By 2026, Gartner predicts that organizations prioritizing their security investments based on a CTEM program will realize a two-thirds reduction in breaches." Gartner, Top Cybersecurity Trends for 2024, 22.02.2024
Der praktische Unterschied zu klassischem Schwachstellenmanagement liegt in Phase vier. Schwachstellenmanagement erzeugt Listen. CTEM erzeugt Nachweise: Diese Exposition ist erreichbar, ausnutzbar und wird von unseren Kontrollen nicht erkannt. Deshalb hat sie Vorrang vor Befunden mit höherem CVSS-Wert, die im eigenen Netz gar nicht erreichbar sind.
Für sie gilt kein TLPT, aber sehr wohl eine Prüfpflicht dem Sinne nach. Das NIS-2-Umsetzungsgesetz ist am 6. Dezember 2025 in Kraft getreten und verpflichtet besonders wichtige und wichtige Einrichtungen nach § 30 BSIG zu Risikomanagementmaßnahmen, darunter Risikoanalyse, Bewältigung von Sicherheitsvorfällen, Business Continuity Management, Sicherheit der Lieferkette und Bewertung der Wirksamkeit dieser Maßnahmen. Der Kreis der regulierten Einrichtungen wächst damit von rund 4.500 auf etwa 29.500.
Die Wirksamkeitsbewertung ohne Validierung zu führen, ist schwer begründbar. Wer die Wirksamkeit seiner Maßnahmen nachweisen soll, braucht einen Nachweis und der entsteht durch die Prüfung. Genau hier liegt der pragmatische Einstieg für Unternehmen ohne DORA-Pflicht: nicht mit einem vollständigen TIBER-Prozess beginnen, sondern mit Validierung als vierter Stufe des vorhandenen Schwachstellenmanagements.
Orange Cyberdefense bündelt diese Leistungen im Bereich Ethical Hacking sowie im Threat and Risk Management mit Vulnerability Management und Security Intelligence.
Die Prüfpraxis vieler Organisationen ist auf ein Bedrohungsbild kalibriert, das nicht mehr gilt. Der Angriff beginnt heute mehrheitlich an einer offenen Schwachstelle und die durchschnittliche Behebungszeit hat sich verlängert statt verkürzt. Bedrohungsgeleitete Prüfung, im Finanzsektor als aufsichtlich vorgeschriebenes Verfahren, in der übrigen Wirtschaft als Betriebsmodell, ist die Antwort darauf.
Entscheidend ist dabei nicht, ein weiteres Testformat einzukaufen, sondern die Reihenfolge umzudrehen: erst festlegen, welche Geschäftsfunktion nicht ausfallen darf, dann prüfen, ob ein realistischer Angreifer sie erreichen könnte und erst dann über Werkzeuge sprechen.
Nein. CTEM ist der Rahmen, in dem Penetrationstests, Red Teaming und automatisierte Angriffssimulation ihren jeweiligen Platz bekommen. Der Penetrationstest bleibt das Mittel der Wahl für die tiefe technische Prüfung eines abgegrenzten Systems.
Das Rahmenwerk nennt für die Vorbereitungsphase bis zu etwa sechs Monate und für die aktive Testphase mindestens zwölf Wochen. Zuzüglich Abschlussphase ist realistisch mit einem Vorhaben zu rechnen, das sich über mehrere Quartale erstreckt.
Nur mit Genehmigung der zuständigen Behörde und bei nachgewiesen ausreichenden dedizierten Ressourcen. Die Threat-Intelligence-Komponente muss dabei nach Artikel 27 Absatz 2 DORA zwingend extern erbracht werden.
TIBER-DE ist ein freiwilliges Programm der Deutschen Bundesbank, TLPT eine verpflichtende Anforderung aus DORA. Operativ nutzen beide das TIBER-EU-Rahmenwerk; zuständige Aufsichtsbehörde für TLPT in Deutschland ist die BaFin.
Artikel 26 DORA sieht das ausdrücklich vor. Absatz 5 verlangt gleichzeitig wirksame Risikomanagement-Kontrollen, um Schäden an Daten, Vermögenswerten und Betrieb zu begrenzen. Die Testdurchführung ist entsprechend abzusichern.
Ein pragmatischer Rhythmus für große Mittelständler: jährlich ein szenariobasierter Red-Team-Durchlauf gegen die kritischste Geschäftsfunktion, kontinuierliche Validierung der Kontrollen dazwischen und Purple-Teaming-Sitzungen nach jedem größeren Befund.
Belastbare Marktpreise werden von keiner Institution veröffentlicht. Der Aufwand skaliert mit Scope-Breite, Dauer der aktiven Testphase und Anzahl der einzubindenden Drittdienstleister; die Vorbereitungsphase macht regelmäßig einen erheblichen Anteil aus.