AI Text Detection

项目展示

Technical

技术深度

BERT 微调结构、Temperature Scaling 校准、二分类决策与基线对比。

Technical Summary

这一页讲清楚“为什么这套方法站得住”

这里不是重复方法页,而是把 BERT 编码结构、置信度校准、二分类判定 和基线对比拆开说明,回答“为什么不是别的方法”和“为什么结果可信”。

核心主干

BERT-base-chinese 微调分类器,负责文档级 Human / AI 判定。

关键增强

Temperature Scaling 校准输出概率,降低高置信度误判风险。

输出口径

当前线上固定输出 Human / AI,低置信样本进入人工复核提示。

架构

BERT 模型架构

基于 BERT-base-chinese 微调的分类器,12 层 Transformer Encoder 提取文本语义特征

12 Layers / 768 Hidden / 12 Heads / 110M Parameters
Input Text
中文文本输入
Tokenizer
BERT WordPiece 分词
Embedding Layer
Token + Position + Segment
12x Transformer Encoder
Multi-Head Attention + FFN
[CLS] Token Output
768维隐藏表示
Classification Head
Linear → Softmax → Human/AI
校准

Temperature Scaling 置信度校准

通过温度参数 T=0.8165 校准模型输出概率,使置信度与真实正确率对齐

ECE: 0.0168 → 0.0034(约 −80%)

原理

Temperature Scaling 对 logits 除以温度参数 T,再经 Softmax 得到校准后概率:

p^=softmax(zT)\hat{p} = \mathrm{softmax}\left(\dfrac{z}{T}\right)

T < 1 使分布更尖锐(更自信),T > 1 使分布更平滑(更保守)。本模型最优 T=0.8165,表明原始输出偏保守,校准后适度增强置信度。

校准前后置信度对比
判定解释

句级复核示例

当前线上使用主分类器做 Human/AI 二分类,并在句级结果中辅助查看风险分布

线上输出: Human / AI

工作原理

当前线上不启用 Span Detector。系统先对整段文本输出 Human / AI 二分类, 再对切分后的句子复用主分类器做辅助判断,帮助查看哪些句子更接近 AI 风格。

Token 标注示例

今天天气很好适合出去散步阳光透过树叶洒落斑驳光影微风轻拂面颊
HumanAI
对比

方法对比

本方案与主流 AI 文本检测方法的多维度对比(定性 + 口径说明)

基于中文 AI 文本检测场景归纳
方法中文支持线上口径准确率实时性可解释性
BERT微调 (本方案)原生支持Human / AI98.56%~50ms风险提示 + 句级结果
GPTZero有限概率/风险分~85%API延迟困惑度分数
DetectGPT需适配检测分数~80%慢 (多次采样)对数概率扰动
水印法需嵌入水印检测~95%水印证据

AI Text Detection

基于 BERT 微调的中文 AI 文本检测系统

当前默认模型为 `bert_v11c_boundary_fix`。本网站展示项目主线、实验结果、在线演示与项目问答,统一使用左侧侧栏组织信息结构。

项目信息

2026 本科毕业设计

西安科技大学 · 计算机科学与技术

陕ICP备2025065501号-2