ブログ
無検閲推論に関するノート — レッドチーミング、拒否率ベンチマーク、そして本番環境での API 運用。
-
Abliterated モデルとは何か?
abliteration は、モデルの残差ストリームにある拒否方向を特定し、重みからその成分を射影で取り除く手法です。再学習も、プロンプトの小細工も要りません。
-
レッドチーミングとセキュリティ研究のための無検閲 LLM API
攻撃者モデルが拒否したとき、測っているのはターゲットの頑健性ではなく攻撃者の慎重さです。セキュリティパイプラインにフィルターなしのエンドポイントが必要な理由。
-
そのまま差し替えられる OpenAI 互換 API — 移行は2行で完了
base_url とキーを変えるだけで、既存の OpenAI SDK を unbleep に向けられます。ストリーミング、モデルティア、reasoning_content、そして実際に足をすくう落とし穴について。