World Model Readiness
Graviertes Instrument für Technik und Risiko

Für Ihr Unternehmen

Technologie & Risiko

Modul · Die Angriffsfläche, die Sie gerade installiert haben

The AI Security & Misuse Check

Jedes KI-Feature, das Sie ausliefern, ist eine neue Angriffsfläche, und das meiste davon ist für ein klassisches Security-Review unsichtbar. Modelle folgen Anweisungen, die in den Daten versteckt sind, die sie lesen, leaken über Kanäle, die niemand kartiert hat, und reichen Angreifern eine freundliche Schnittstelle zu Ihren Systemen. Dieses Modul prüft die fünf Bausteine, die zählen: Prompt Injection, Datenabfluss, Zugriffskontrolle auf Modelle, adversariales Testen und Datenabfluss-Kontrollen auf den KI-Tools, die Ihre Mitarbeitenden bereits nutzen.

Frage 1 von 5 · Prompt Injection getestet

Haben Sie getestet, ob nicht vertrauenswürdige Eingaben Ihre KI-Features kapern können?

Jedes Modell, das externe Inhalte liest (E-Mails, Dokumente, Webseiten, Tickets), kann von diesen Inhalten angewiesen werden. Prompt Injection macht aus Ihrem hilfreichen Assistenten das Werkzeug von jemand anderem. Wenn Sie es nie selbst versucht haben, gehen Sie davon aus, dass es bereits funktioniert.

Frage 2 von 5 · Abflusspfade kartiert

Kennen Sie jeden Pfad, über den ein KI-Feature Daten offenlegen könnte, die es nicht offenlegen sollte?

LLM-Features leaken auf leise Arten: ein Chatbot, der über die Datensätze eines anderen Kunden Auskunft gibt, ein Zusammenfasser, der Dokumente jenseits der Berechtigungen des Nutzers einbezieht, Logs, die Prompts voller Geheimnisse festhalten. Kartieren Sie die Pfade selbst, oder ein Außenstehender kartiert sie für Sie.

Frage 3 von 5 · Modellzugriff kontrolliert

Wird der Zugriff auf Ihre Modelle und deren Schlüssel wie jedes andere Produktions-Credential gesteuert?

API-Schlüssel in geteilte Chat-Kanäle kopiert, ein Service-Account hinter jedem Feature, keine Rate Limits, kein Nachweis, wer was aufgerufen hat. Modellzugriff ist oft das am schlechtesten gesteuerte Credential im Haus und im Missbrauchsfall eines der teuersten.

Frage 4 von 5 · Jemand macht Red-Teaming

Versucht irgendjemand gezielt, Ihre KI-Systeme zu brechen, bevor Angreifer es tun?

Klassische Penetrationstests decken Jailbreaks, Prompt Injection oder Modellmissbrauch nicht ab; sie wurden für eine andere Bedrohung geschrieben. Wenn niemand Ihre KI-Features adversarial abklopft, ist Ihr erstes Red Team ein echtes, und es schickt Ihnen keinen Bericht.

Frage 5 von 5 · DLP auf KI-Endpunkten

Können Sie erkennen und stoppen, wenn sensible Daten in die KI-Tools Ihrer Mitarbeitenden fließen?

Mitarbeitergerichtete KI ist ein Exfiltrationskanal mit freundlichem Gesicht. Ohne Datenabfluss-Kontrollen auf diesen Endpunkten verlassen Quellcode, Kundenlisten und Vertragsentwürfe das Haus lautlos, ein Copy-Paste nach dem anderen, und Sie erfahren davon in der Meldung der Datenpanne.

Für die Statistik · je ein Klick

Drei Fragen für das Gesamtbild

Diese Fragen beeinflussen Ihr Ergebnis nicht. Sie fließen in die anonymisierten, aggregierten Statistiken ein; Gruppen unter 8 Teilnehmern werden nie ausgewiesen.

Hat Ihr Unternehmen je ein KI-System adversarial getestet?

Nie
Geplant
Einmal
Regelmäßig
Keine KI in Produktion

Hatten Sie einen Sicherheitsvorfall, an dem ein KI-Feature beteiligt war?

Nicht dass wir wüssten
Ein Beinahe-Fehler, rechtzeitig erkannt
Ja, geringfügig
Ja, ernst
Wir könnten es nicht erkennen

Haben Sie Datenabfluss-Kontrollen auf den KI-Tools, die Mitarbeitende nutzen?

Keine
Nur Richtlinie
Teilweise Abdeckung
Volle Abdeckung
Wir wissen es nicht

Ihr Kontext

Kalibriert den Report. Unternehmensgröße und Sektor bleiben im anonymisierten Datensatz; Ihre E-Mail-Adresse nicht.

So sehen die fünf Stufen aus

Jede Dimension dieses Assessments wird von 1 bis 5 bewertet. Das bedeuten die Stufen, Dimension für Dimension. Der benotete Report diagnostiziert, wo Ihre eigenen Antworten landen und was daraus folgt.

Prompt Injection getestet

  1. 1Nie davon gehört
  2. 2Bekannt, ungetestet
  3. 3Einmal getestet
  4. 4Getestet, einige Kontrollen
  5. 5Getestet und überwacht

Am unteren Ende: Prompt Injection ist die SQL Injection des KI-Zeitalters, und der Versuch ist trivial. Verbringen Sie einen Nachmittag damit, Ihr eigenes Feature mit versteckten Anweisungen zu kapern; das Ergebnis bestimmt Ihre Prioritäten. So sieht gut aus: Getestete Abwehr mit Überwachung ist der Zustand, den Sie wollen. Testen Sie weiter, während sich Features ändern; jede neue Datenquelle, die Ihr Modell liest, ist ein neuer Injektionspfad.

Abflusspfade kartiert

  1. 1Keine Ahnung
  2. 2Nie kartiert
  3. 3Teilweise kartiert
  4. 4Größtenteils kartiert
  5. 5Kartiert und kontrolliert

Am unteren Ende: Daten, die Sie nicht abfließen sehen, können Sie nicht schützen. Listen Sie jedes KI-Feature auf und halten Sie je Feature fest, welche Daten es erreichen kann und wo seine Ein- und Ausgaben gespeichert werden. So sieht gut aus: Ein kartierter und kontrollierter Datenfluss ist genau das, was Auditor und Angreifer beide zuerst abklopfen. Halten Sie ihn aktuell, während Features und Integrationen wachsen.

Modellzugriff kontrolliert

  1. 1Schlüssel überall
  2. 2Ein geteilter Account
  3. 3Basiskontrollen
  4. 4Begrenzt und protokolliert
  5. 5Least Privilege, rotiert

Am unteren Ende: Lose Modellschlüssel sind eine Datenpanne, die nur auf ihr Publikum wartet. Inventarisieren Sie in dieser Woche, wo die Schlüssel liegen, ziehen Sie die in geteilten Kanälen ein, und stellen Sie jeden Aufruf hinter einen nachvollziehbaren Account. So sieht gut aus: Mit rotiertem Modellzugriff nach Least Privilege sind Sie weiter als die meisten Teams, die KI ausliefern. Lassen Sie die Logs weiter prüfen; ein unbeobachtetes Log ist ein Credential, das niemand bewacht.

Jemand macht Red-Teaming

  1. 1Nie
  2. 2Ad-hoc-Neugier
  3. 3Einmalige Übung
  4. 4Periodisches Red-Teaming
  5. 5Kontinuierliches adversariales Testen

Am unteren Ende: Ungetestete KI ist ein Versprechen, das Sie nie geprüft haben. Führen Sie eine strukturierte adversariale Sitzung gegen Ihr kritischstes Feature durch; schon ein halber Tag legt die offensichtlichen Löcher frei. So sieht gut aus: Kontinuierliches adversariales Testen ist der Standard, den das Risiko verdient. Speisen Sie jeden Befund zurück in die Kontrollen, damit derselbe Bruch nicht zweimal funktioniert.

DLP auf KI-Endpunkten

  1. 1Keine Kontrollen
  2. 2Nur Richtlinie
  3. 3Etwas Monitoring
  4. 4DLP auf Hauptendpunkten
  5. 5DLP auf allen Endpunkten

Am unteren Ende: Eine geschriebene Regel stoppt kein Copy-Paste. Beginnen Sie mit Monitoring auf den KI-Endpunkten, zu denen Mitarbeitende tatsächlich greifen, damit Sie den Abfluss sehen, bevor Sie versuchen, ihn zu kontrollieren. So sieht gut aus: Datenabfluss-Kontrollen über Ihre KI-Endpunkte schließen den Kanal, den die meisten Unternehmen weit offen lassen. Kombinieren Sie die Durchsetzung mit einem freigegebenen Tool, das gut genug ist, dass niemand es umgeht.