从技术角度看,一款像样的 AIGC 检测器,背后至少有 三层能力:
- 识别'是不是 AI 产的'(分类层)
- 判断'质量 / 真实性 / 违规风险'(内容理解层)
- 在真实业务场景里'能跑得起来'(系统工程层)
一、核心识别技术:怎么判断'AI 还是人'
1. 经典统计特征 + 机器学习
这块是'基础款',但在真实系统里仍然很有用,尤其是和更复杂模型组合成特征。
需要的技术:
- NLP 预处理
- 中文分词 / 子词切分(BPE、SentencePiece)
- 句子切分、标点结构分析
- 统计特征工程
- 词频 / n-gram 特征(比如字符 n-gram、词 n-gram)
- 句长分布、词长分布
- 复杂度指标(熵、困惑度、Type-Token Ratio)
- 标点使用模式、停用词比例
- 传统 ML 模型
- Logistic Regression / Linear SVM
- XGBoost / LightGBM
把上面特征丢进去做'AI vs 人类'的分类。
优点:
- 易解释,可做线上轻量特征; 缺点:
- 面对最新大模型 + 人工轻微改写,很容易被绕过;
- 但作为排序/风控特征,是不错的'第一层信号'。
2. 基于'困惑度(Perplexity)'的检测
思路:大模型生成的文本,对语言模型来说往往'太顺了',困惑度偏低;人类写的有更多'不规则'。
技术要点:
- 训练或调用一个 基准语言模型(可以是中等大小的 GPT-like 模型)
- 对文本按 token 计算:
- 条件概率
- 平均负对数似然 / 困惑度
- 构造特征:
- 整体困惑度均值 / 方差
- 分句困惑度波动
- 局部异常点(哪里'顺得过头')
实现路径:
- PyTorch / TensorFlow:加载一个已有 LLM(开源的中文模型也行)
- 对每个文档跑一次 forward,拿到 log prob,算困惑度
- 再把这些数值作为特征,喂给上层分类器(比如一个 GBDT 或小神经网络)
3. 专门的'AI 文本分类器'(判别模型)
这是现在最主流、效果最好的那层: 直接训练一个模型去判「AI vs Human」。
技术栈:
- 预训练模型:BERT / RoBERTa / DeBERTa / 中文专用 Transformer(MacBERT、Erlangshen 等)
- 微调方法:
- 文本分类微调(CLS 向量接一个二分类头)
- 可增加多标签输出:
- 是否 AI 生成
- 可能来源模型(GPT-4 / ChatGPT / 文心 / 通义 / 自家模型等)
- AI 痕迹强度(0–1 分)
- 训练数据构建:
- 正样本:多种模型、多种 Prompt、多领域、多长度
- 负样本:真实文章、论坛帖子、代码注释、客服记录等
- 对抗样本:
- 人工稍微改写的 AI 文本
- 用 paraphrase 模型 / 翻译回译处理后的 AI 文本
需要的技术能力:
- 熟悉 Transformer 模型微调(HuggingFace / Megatron / DeepSpeed 等)
- 数据清洗、采样、去重、类别平衡
- 模型评估指标:AUC、F1、Precision@Recall 等(根据业务选择)
4. 针对'改写 / 伪装'的对抗检测技术
用户一旦知道你在检测,就会:
- 用其它模型二次改写
- 用翻译器来回翻译
- 人工稍微'打乱句子'来绕过
应对方案涉及的技术:
- 语义对齐 / 含义稳定性检测
- 通过文本嵌入(Sentence-BERT、SimCSE、开源 Embedding 模型),判断:
- 文本局部语义是否异常统一
- 过度流畅、缺少'人类错误'的地方
- 通过文本嵌入(Sentence-BERT、SimCSE、开源 Embedding 模型),判断:
- 风格特征建模
- 用风格迁移 / 作者识别相关技术,检测:
- 用词多样性 vs 模型常用短语分布
- 人称/时态/语气切换的自然程度
- 用风格迁移 / 作者识别相关技术,检测:
- 对抗训练
- 在训练集中加入大量'改写过的 AI 文本',迫使分类器学会识别'伪装后的 AI'。
5. 多模态场景(图像 / 视频 / 音频)
如果你要做文本以外的 AIGC 检测,需要:
图像 / 视频
- 深度合成检测(Deepfake Detection)相关技术
- CNN / ViT 检测纹理异常、噪声模式
- 频域特征(FFT)、压缩痕迹、插值痕迹
- 元数据分析
- EXIF、编码参数、生成模型水印(如果有)
- 视频时序一致性检测
- 帧间人脸特征跳变
- 光照 / 运动轨迹是否稳定
音频
- 语音指纹分析、频谱特征
- 声码器特征(人工与 TTS 合成声差异)
如果你当前主要做 搜索 / 排名 / 文本质量,可以先聚焦文本检测,图像视频之后做。
二、内容理解与风控层:不仅是'谁写的',还要'值不值得信'
很多甲方不会只问:
是不是 AI 写的?
而是更关心:
既然是 AI 写的,它到底靠不靠谱,有没有踩红线?
这就需要第二层技术:
1. 事实性与幻觉检测
- 信息抽取(NER、关系抽取):抽出实体、数字、时间
- 与知识库 / 搜索结果对比:
- 是否存在明显矛盾
- 医疗、金融等专业领域是否与'权威数据'一致
- 技术点:
- 向量检索(Faiss / Milvus / pgvector 等)
- 检索增强评估(RAG + consistency check)
2. 违规内容检测(合规)
- 敏感内容分类模型:
- 政治、暴力、涉黄、仇恨、违法、诈骗等类目
- 关键词 + 模型结合:
- 高频敏感词规则
- 深度模型二次判断上下文
3. 质量与可读性评分
- 可读性指标:句法复杂度、冗余度、重复率
- 主题一致性、逻辑连贯性评估(topic model + embedding 聚类)
- 最终输出一个综合评分:AI 生成概率 + 风险级别 + 质量分
这些东西,对你未来要接入排序/推荐系统时非常有用,可以直接作为排序特征或过滤规则。
三、系统与工程层:把模型变成'能上生产的服务'
1. 模型服务化 & 推理优化
- 模型框架:
- PyTorch / TensorFlow / JAX
- Serving:Triton Inference Server / TorchServe / 自建 Flask/FastAPI + ONNX Runtime
- 推理效率优化:
- 模型蒸馏(从大模型 → 小模型)
- 量化(INT8 / FP16)
- Batch 请求、防止 QPS 打爆
- 多模型协同:
- 轻量模型做第一层筛选(高疑似 or 低疑似直接判)
- 中重模型只对'中间灰色样本'做精细判断,节约算力
2. 数据闭环与持续学习
- 日志与标注体系:
- 线上判定结果 + 用户行为(举报、通过、封禁等)
- 人工复核结果 → 反哺训练集
- 训练管线:
- 定期抽样 + 重新训练 / 微调
- 对抗样本(绕过检测的新手法)加入训练集
- 基础设施:
- 数据仓库(Hive / ClickHouse / BigQuery / 湖仓一体)
- 特征计算(Flink / Spark Streaming)
- 模型训练流水线(Airflow、KubeFlow 等)

