MCP rehberi · LLM Red Team

@guardbee/mcp-llm-redteam, size ait veya test izniniz olan canlı LLM endpoint ve chatbot’ların guardrail’lerini aktif olarak sınar. Statik kod taraması yapmaz; gerçek hedefe güvenli, tek kullanımlık canary token’lar içeren probe istekleri gönderir ve modelin override talimatına uyup uymadığını ölçer.
Ne işe yarar?
Araç, OpenAI uyumlu API’ler, Anthropic Messages API veya özel webhook üzerinde 12 probe çalıştırır. Jailbreak, system prompt extraction, base64/zero-width obfuscation, sahte sistem yetkisiyle refusal suppression ve çok dilli override kategorilerini kapsar. Başarı, modelin rastgele canary token’ı tekrar etmesiyle deterministik olarak ölçülür; probe’lar gerçek zararlı içerik istemez.
Kimler için?
- Production öncesi staging chatbot guardrail’lerini doğrulayan AI güvenlik ekipleri
- OpenAI, Anthropic, Groq, vLLM veya uyumlu gateway kullanan ürün ekipleri
- Her deploy sonrası tekrarlanabilir LLM güvenlik kontrolü isteyen DevSecOps ekipleri
- Kendi webhook tabanlı chatbot’unu Claude veya Cursor üzerinden test eden geliştiriciler
Ne değildir?
- Sahibi olmadığınız veya açık test izniniz bulunmayan endpoint’ler
- Modelden gerçek zararlı çıktı istemek veya yeni saldırı tekniği geliştirmek
- Tek başına tam kapsamlı manuel red team ve risk değerlendirmesinin yerine geçmek
Özellikler
| Özellik | Açıklama |
|---|---|
| 12 probe / 5 kategori | instruction-override, extraction, obfuscation, refusal-suppression, multilingual |
| Canary tabanlı ölçüm | Zararlı içerik üretmeden deterministik bypass kanıtı |
| 3 hedef tipi | OpenAI uyumlu API, Anthropic Messages API veya özel webhook |
| Düzeltme önerisi | Her bypass için neden önemli ve guardrail nasıl güçlendirilir |
| CI/CD modu | Staging chatbot’u deploy sonrası fail-on eşiğiyle test edin |
MCP araçları
| Araç | Açıklama |
|---|---|
list_probes | Tüm probe’ları kategori ve önem seviyesiyle listeler; ağ çağrısı yapmaz |
run_probe_suite | Yetkili hedefte probe setini çalıştırır ve bypass edilen guardrail’leri raporlar |
npm ile kurulum
Global kurulum (Claude Desktop / Cursor için pratik):
npm install -g @guardbee/mcp-llm-redteamveya npx ile (config içinde -y önerilir):
npx -y @guardbee/mcp-llm-redteamCI/CD örneği: npx @guardbee/mcp-llm-redteam probe --type=openai --model=gpt-4o-mini --api-key-env=OPENAI_API_KEY --fail-on=high. Özel chatbot: --type=webhook --url=https://staging.example.com/chat. API anahtarını parametre olarak vermeyin; yalnızca önceden tanımlı environment variable adını apiKeyEnv ile belirtin. Her probe hedef API kotası tüketir.
Claude Desktop yapılandırması
Config dosya yolları:
- macOS
~/Library/Application Support/Claude/claude_desktop_config.json - Windows
%APPDATA%\Claude\claude_desktop_config.json - Linux
~/.config/Claude/claude_desktop_config.json
Aşağıdaki bloğu ekleyip Claude Desktop’ı yeniden başlatın:
{
"mcpServers": {
"guardbee-llm-redteam": {
"command": "npx",
"args": [
"-y",
"@guardbee/mcp-llm-redteam"
],
"env": {
"OPENAI_API_KEY": "sk-..."
}
}
}
}Cursor / diğer MCP istemcileri
Cursor’da Settings → MCP altına aynı command / args / env alanlarını ekleyin. stdio tabanlı MCP sunucuları Claude Desktop ile aynı sözleşmeyi kullanır.
Claude’da örnek kullanım
- “OpenAI endpoint’imde gpt-4o-mini için güvenli GuardBee red-team suite çalıştır”
- “Kullanılabilir LLM red-team probe’larını kategoriye göre listele”
- “Staging webhook’umda hangi guardrail testleri bypass edildi ve nasıl düzeltebilirim?”
İlgili linkler
Guardbee ile yüzey riskini görün
MCP sunucuları sohbet içinde güvenlik işlerini hızlandırır. Marka taraması ve BeeAI için 14 gün ücretsiz deneme ile başlayın.
Sık sorulan sorular
Testler zararlı içerik üretir mi?
Hayır. Her probe tek kullanımlık rastgele canary token ile ölçülür; gerçek zararlı içerik istenmez.
Hangi hedefleri destekler?
OpenAI Chat Completions uyumlu servisler, Anthropic Messages API ve POST { prompt } kabul eden özel webhook’lar.
Production’da çalıştırabilir miyim?
Yalnızca size ait veya açıkça yetkilendirildiğiniz hedeflerde. Önce staging’de başlayın; probe’lar gerçek istek gönderir ve kota tüketir.