Blog
Notizen zu unzensierter Inferenz – Red-Teaming, Refusal-Benchmarks und der Betrieb der API in Produktion.
-
Was ist ein abliterated Modell?
Abliteration findet die Refusal-Richtung im Residual Stream und projiziert sie aus den Gewichten heraus – kein Retraining, keine Prompt-Tricks.
-
Eine unzensierte LLM-API für Red-Teaming und Security-Research
Lehnt dein Angreifermodell ab, misst du seine Vorsicht statt der Robustheit deines Ziels. Warum Security-Pipelines einen ungefilterten Endpunkt brauchen.
-
Eine OpenAI-kompatible Drop-in-API – Migration in zwei Zeilen
Bestehendes OpenAI-SDK auf unbleep richten: base_url und Key ändern. Streaming, Modellstufen, reasoning_content und die Fallstricke, die wirklich zubeißen.