Experiments
实验结果
性能指标、版本对比、校准与消融;图表与表格与论文口径一致。
Defense Summary
实验结果先看什么
V11c 当前是综合表现最稳定的版本,既在三集平均和独立评估集上保持高准确率, 又通过置信度校准降低了“分数看起来高但不可信”的风险。
模型版本对比
各版本准确率与 F1 分数对比;V11c 高亮。
Key InsightV11c 三集平均准确率达到 98.56%,相比 V10 提升 0.20 个百分点;独立评估集从 97.69% 提升到 98.57%,错误数减少 38%。
与基线方法怎么比较
这部分说明比较过程:固定数据、统一指标,再看不同模型的收益和代价。
先固定评估集,避免不同模型在不同数据上比较导致结论失真。
再比较轻量基线、CNN 系列、BERT 变体和最终 V11c 主模型。
除总准确率外,同时看独立评估集、混淆矩阵、误报/漏报和校准误差。
最终选择 V11c,不是因为模型最大,而是因为综合泛化、稳定性和部署成本最平衡。
| 方法 | 比较口径 | 结果 | 结论 |
|---|---|---|---|
| FastText | 词袋/子词特征 + 线性分类 | 89.2% | 速度快,但难以捕捉长距离语义 |
| TextCNN | 卷积窗口提取局部 n-gram 特征 | 93.1% | 比 FastText 强,但对上下文理解有限 |
| DPCNN | 深层金字塔 CNN 捕捉局部层级特征 | 约94% | 能建模层级特征,但泛化仍弱于 BERT |
| BERT-BiGRU | BERT 表示后接 BiGRU 序列建模 | 接近主模型 | 结构更复杂,收益不足以替代 V11c |
| BERT V11c | bert-base-chinese 微调 + 数据治理 + 校准 | 98.56% | 综合准确率、稳定性和部署成本最好 |
Key InsightBERT 微调方案以 98.56% 三集平均准确率显著优于 FastText (89.2%) 和 TextCNN (93.1%) 等轻量基线,同时保留可部署性。
V11c vs V10 性能雷达
四项核心指标的综合对比
Key InsightBERT 微调方案以 98.56% 准确率显著超越 FastText (89.2%) 和 TextCNN (93.1%) 基线
版本迭代趋势
三集平均与独立评估集准确率随版本变化
混淆矩阵
基于三套 fair test 共 2,599 条样本的综合混淆矩阵
Key InsightTemperature Scaling (T=0.8165) 将 ECE 从 0.0168 降至 0.0034,校准误差下降约 80%
评估集详细指标
| 评估集 | 精确率 | 召回率 | F1分数 | 支持数 |
|---|---|---|---|---|
| merged_v2_val_clean | 98.07% | 100.00% | 99.03% | 1,144 |
| core_v1_test_clean | 97.87% | 98.77% | 98.32% | 545 |
| independent_data | 93.08% | 98.67% | 95.79% | 910 |
| 三集汇总(加权) | 97.22% | 99.39% | 98.29% | 2,599 |
消融实验对比
不同训练策略下的性能变化
| 配置 | 三集平均 | 独立评估 |
|---|---|---|
| V11c (风险治理+长文修复) | 98.56% | 98.57% |
| V10 (数据增强) | 98.36% | 97.69% |
| V9 (P0增强) | 97.31% | 94.73% |
| V8 (校准版) | 96.88% | 94.40% |
| V6 (合并版) | 95.85% | 93.19% |
Key Insight线上版本以 V11c 二分类稳定性为主,混合文本实验仅作为历史探索保留
置信度校准曲线
预测置信度与实际准确率的对应关系
Temperature Scaling: T=0.8165, ECE=0.0034 — 校准后模型置信度与实际准确率高度一致
关键发现
分类性能优异
在二分类任务上验证准确率98.75%,三集平均98.56%
当前稳定模型
V11c 仍是当前综合表现最稳定的默认分类模型
独立评估集验证
在910条含真实LLM输出的独立数据上达98.57%
置信度校准
Temperature Scaling(T=0.8165)将ECE降至0.0034
多模型泛化
覆盖GPT-5/DeepSeek/Gemini/LLaMA等多模型输出
保守部署策略
默认采用更保守的AI判定阈值,优先降低人类文本误判风险