← Blog’a dön

← Back to blog

MCP LLM Red Team: canlı chatbot guardrail testi

,

MCP rehberi · LLM Red Team

MCP LLM Red Team: canlı chatbot guardrail testi
@guardbee/mcp-llm-redteam

@guardbee/mcp-llm-redteam, size ait veya test izniniz olan canlı LLM endpoint ve chatbot’ların guardrail’lerini aktif olarak sınar. Statik kod taraması yapmaz; gerçek hedefe güvenli, tek kullanımlık canary token’lar içeren probe istekleri gönderir ve modelin override talimatına uyup uymadığını ölçer.

Ne işe yarar?

Araç, OpenAI uyumlu API’ler, Anthropic Messages API veya özel webhook üzerinde 12 probe çalıştırır. Jailbreak, system prompt extraction, base64/zero-width obfuscation, sahte sistem yetkisiyle refusal suppression ve çok dilli override kategorilerini kapsar. Başarı, modelin rastgele canary token’ı tekrar etmesiyle deterministik olarak ölçülür; probe’lar gerçek zararlı içerik istemez.

Kimler için?

  • Production öncesi staging chatbot guardrail’lerini doğrulayan AI güvenlik ekipleri
  • OpenAI, Anthropic, Groq, vLLM veya uyumlu gateway kullanan ürün ekipleri
  • Her deploy sonrası tekrarlanabilir LLM güvenlik kontrolü isteyen DevSecOps ekipleri
  • Kendi webhook tabanlı chatbot’unu Claude veya Cursor üzerinden test eden geliştiriciler

Ne değildir?

  • Sahibi olmadığınız veya açık test izniniz bulunmayan endpoint’ler
  • Modelden gerçek zararlı çıktı istemek veya yeni saldırı tekniği geliştirmek
  • Tek başına tam kapsamlı manuel red team ve risk değerlendirmesinin yerine geçmek

Özellikler

ÖzellikAçıklama
12 probe / 5 kategoriinstruction-override, extraction, obfuscation, refusal-suppression, multilingual
Canary tabanlı ölçümZararlı içerik üretmeden deterministik bypass kanıtı
3 hedef tipiOpenAI uyumlu API, Anthropic Messages API veya özel webhook
Düzeltme önerisiHer bypass için neden önemli ve guardrail nasıl güçlendirilir
CI/CD moduStaging chatbot’u deploy sonrası fail-on eşiğiyle test edin

MCP araçları

AraçAçıklama
list_probesTüm probe’ları kategori ve önem seviyesiyle listeler; ağ çağrısı yapmaz
run_probe_suiteYetkili hedefte probe setini çalıştırır ve bypass edilen guardrail’leri raporlar

npm ile kurulum

Global kurulum (Claude Desktop / Cursor için pratik):

bash
npm install -g @guardbee/mcp-llm-redteam

veya npx ile (config içinde -y önerilir):

bash
npx -y @guardbee/mcp-llm-redteam

npm: @guardbee/mcp-llm-redteam

CI/CD örneği: npx @guardbee/mcp-llm-redteam probe --type=openai --model=gpt-4o-mini --api-key-env=OPENAI_API_KEY --fail-on=high. Özel chatbot: --type=webhook --url=https://staging.example.com/chat. API anahtarını parametre olarak vermeyin; yalnızca önceden tanımlı environment variable adını apiKeyEnv ile belirtin. Her probe hedef API kotası tüketir.

Claude Desktop yapılandırması

Config dosya yolları:

  • macOS~/Library/Application Support/Claude/claude_desktop_config.json
  • Windows%APPDATA%\Claude\claude_desktop_config.json
  • Linux~/.config/Claude/claude_desktop_config.json

Aşağıdaki bloğu ekleyip Claude Desktop’ı yeniden başlatın:

claude_desktop_config.json
{
  "mcpServers": {
    "guardbee-llm-redteam": {
      "command": "npx",
      "args": [
        "-y",
        "@guardbee/mcp-llm-redteam"
      ],
      "env": {
        "OPENAI_API_KEY": "sk-..."
      }
    }
  }
}

Cursor / diğer MCP istemcileri

Cursor’da Settings → MCP altına aynı command / args / env alanlarını ekleyin. stdio tabanlı MCP sunucuları Claude Desktop ile aynı sözleşmeyi kullanır.

Claude’da örnek kullanım

  1. “OpenAI endpoint’imde gpt-4o-mini için güvenli GuardBee red-team suite çalıştır”
  2. “Kullanılabilir LLM red-team probe’larını kategoriye göre listele”
  3. “Staging webhook’umda hangi guardrail testleri bypass edildi ve nasıl düzeltebilirim?”

İlgili linkler

Guardbee ile yüzey riskini görün

MCP sunucuları sohbet içinde güvenlik işlerini hızlandırır. Marka taraması ve BeeAI için 14 gün ücretsiz deneme ile başlayın.

Ücretsiz başlayın MCP sunucuları

Sık sorulan sorular

Testler zararlı içerik üretir mi?

Hayır. Her probe tek kullanımlık rastgele canary token ile ölçülür; gerçek zararlı içerik istenmez.

Hangi hedefleri destekler?

OpenAI Chat Completions uyumlu servisler, Anthropic Messages API ve POST { prompt } kabul eden özel webhook’lar.

Production’da çalıştırabilir miyim?

Yalnızca size ait veya açıkça yetkilendirildiğiniz hedeflerde. Önce staging’de başlayın; probe’lar gerçek istek gönderir ve kota tüketir.

Paylaş

Share

Sitenizin risk skorunu görün — 14 gün ücretsiz deneme.

See your site’s risk score — 14-day free trial.