最近 OpenAI 和 Anthropic 都发生了越狱事件,而且公司根本不知道。
核心问题:AI 产生的输出,谁来验证?
我做了 HallucC Guard — 一个 AI 安全网关 API:
// 1行代码接入
const { passed, risk_score, threats } = await guard.check(prompt, output);
if (!passed) return block(threats);
支持:
✅ Prompt注入检测(20+ 特征模式)
✅ 越狱痕迹检测(DAN/developer mode/身份伪装)
✅ 有害内容检测(恶意软件/危险品/仇恨言论)
✅ 幻觉检测(可选)
OWASP LLM Top 10 对齐,40+检测特征。
免费试用:https://aihcc.cloud/guard


























































