블로그
무검열 추론에 관한 노트 — 레드티밍, 거부율 벤치마크, 그리고 프로덕션에서의 API 운영.
-
Abliterated 모델이란 무엇인가?
Abliteration은 모델의 잔차 스트림에서 거부 방향을 찾아 가중치에서 투영해 제거합니다 — 재학습도, 프롬프트 트릭도 없이.
-
레드티밍과 보안 연구를 위한 무검열 LLM API
공격자 모델이 거부하면, 대상의 견고성이 아니라 도구의 신중함을 재고 있는 것입니다. 보안 파이프라인에 필터 없는 엔드포인트가 필요한 이유.
-
드롭인 OpenAI 호환 API — 두 줄이면 끝나는 마이그레이션
base_url과 키만 바꿔 기존 OpenAI SDK를 unbleep에 연결하세요. 스트리밍, 모델 티어, reasoning_content, 그리고 실제로 문제를 일으키는 함정들.