AI Text Detection

项目展示

Experiments

实验结果

性能指标、版本对比、校准与消融;图表与表格与论文口径一致。

Defense Summary

实验结果先看什么

V11c 当前是综合表现最稳定的版本,既在三集平均和独立评估集上保持高准确率, 又通过置信度校准降低了“分数看起来高但不可信”的风险。

0.00%
验证准确率
0.00%
三集平均
0.00%
独立评估集
0.00
校准后 ECE
版本迭代

模型版本对比

各版本准确率与 F1 分数对比;V11c 高亮。

Key InsightV11c 三集平均准确率达到 98.56%,相比 V10 提升 0.20 个百分点;独立评估集从 97.69% 提升到 98.57%,错误数减少 38%。

比较过程

与基线方法怎么比较

这部分说明比较过程:固定数据、统一指标,再看不同模型的收益和代价。

Step 1

先固定评估集,避免不同模型在不同数据上比较导致结论失真。

Step 2

再比较轻量基线、CNN 系列、BERT 变体和最终 V11c 主模型。

Step 3

除总准确率外,同时看独立评估集、混淆矩阵、误报/漏报和校准误差。

Step 4

最终选择 V11c,不是因为模型最大,而是因为综合泛化、稳定性和部署成本最平衡。

方法比较口径结果结论
FastText词袋/子词特征 + 线性分类89.2%速度快,但难以捕捉长距离语义
TextCNN卷积窗口提取局部 n-gram 特征93.1%比 FastText 强,但对上下文理解有限
DPCNN深层金字塔 CNN 捕捉局部层级特征约94%能建模层级特征,但泛化仍弱于 BERT
BERT-BiGRUBERT 表示后接 BiGRU 序列建模接近主模型结构更复杂,收益不足以替代 V11c
BERT V11cbert-base-chinese 微调 + 数据治理 + 校准98.56%综合准确率、稳定性和部署成本最好

Key InsightBERT 微调方案以 98.56% 三集平均准确率显著优于 FastText (89.2%) 和 TextCNN (93.1%) 等轻量基线,同时保留可部署性。

多维度对比

V11c vs V10 性能雷达

四项核心指标的综合对比

Key InsightBERT 微调方案以 98.56% 准确率显著超越 FastText (89.2%) 和 TextCNN (93.1%) 基线

趋势分析

版本迭代趋势

三集平均与独立评估集准确率随版本变化

分类详情

混淆矩阵

基于三套 fair test 共 2,599 条样本的综合混淆矩阵

预测 · 人类
预测 · AI
实际·人类
1,586
61.0%
TN
28
1.1%
FP
实际·AI
6
0.2%
FN
979
37.7%
TP

Key InsightTemperature Scaling (T=0.8165) 将 ECE 从 0.0168 降至 0.0034,校准误差下降约 80%

详细指标

评估集详细指标

评估集精确率召回率F1分数支持数
merged_v2_val_clean98.07%100.00%99.03%1,144
core_v1_test_clean97.87%98.77%98.32%545
independent_data93.08%98.67%95.79%910
三集汇总(加权)97.22%99.39%98.29%2,599
消融实验

消融实验对比

不同训练策略下的性能变化

配置三集平均独立评估
V11c (风险治理+长文修复)98.56%98.57%
V10 (数据增强)98.36%97.69%
V9 (P0增强)97.31%94.73%
V8 (校准版)96.88%94.40%
V6 (合并版)95.85%93.19%

Key Insight线上版本以 V11c 二分类稳定性为主,混合文本实验仅作为历史探索保留

校准分析

置信度校准曲线

预测置信度与实际准确率的对应关系

Temperature Scaling: T=0.8165, ECE=0.0034 — 校准后模型置信度与实际准确率高度一致

实验总结

关键发现

分类性能优异

在二分类任务上验证准确率98.75%,三集平均98.56%

当前稳定模型

V11c 仍是当前综合表现最稳定的默认分类模型

独立评估集验证

在910条含真实LLM输出的独立数据上达98.57%

置信度校准

Temperature Scaling(T=0.8165)将ECE降至0.0034

多模型泛化

覆盖GPT-5/DeepSeek/Gemini/LLaMA等多模型输出

保守部署策略

默认采用更保守的AI判定阈值,优先降低人类文本误判风险

AI Text Detection

基于 BERT 微调的中文 AI 文本检测系统

当前默认模型为 `bert_v11c_boundary_fix`。本网站展示项目主线、实验结果、在线演示与项目问答,统一使用左侧侧栏组织信息结构。

项目信息

2026 本科毕业设计

西安科技大学 · 计算机科学与技术

陕ICP备2025065501号-2