Reflections
心得体会
个人感悟、项目时间线与致谢(版式与其他内容页一致)。
Reflection Summary
这一页负责把项目经历收束成项目结尾
在方法、数据、实验和系统展示之后,这一页用时间线、收获和致谢把整个毕业设计闭合起来, 让网站从“项目展示”回到“完整毕设叙事”。
从选题、数据治理到论文撰写与展示准备的完整历程。
不仅是模型训练,也包括工程部署、论文写作和实验组织。
从研究课题延伸到可在线访问的实际系统。
作为结尾页面,形成完整项目印象。
个人感悟
回顾这半年多的毕设历程,从最初对AI文本检测的懵懂认识,到现在能够独立完成一个完整的检测系统, 这个过程充满了挑战,也收获了成长。
最初选择这个课题时,我被AI生成文本检测这个前沿问题所吸引。随着ChatGPT等大模型的普及, AI生成的文本越来越难以辨别,这给学术诚信、信息真实性等领域带来了新的挑战。 我希望能够为解决这个问题贡献自己的一份力量。
在研究过程中,我深刻体会到了科研工作的艰辛与乐趣。每当遇到瓶颈时的焦虑, 每当取得突破时的喜悦,这些经历都推动了项目不断成熟。混合文本方案虽然做过实验, 但由于样本数量和真实分布支撑不足,最终没有纳入线上主链路,这也说明工程落地需要克制。
项目时间线
选题确定
确定研究方向,开始文献调研
数据收集
收集和整理中文文本数据
数据标注
完成数据集构建和标注工作
模型开发
实现BERT分类模型与迭代训练
实验探索
尝试混合文本方案,最终未纳入线上主链路
风险治理
V10→V11c数据清洗与模型优化
论文撰写
撰写毕业论文
展示准备
部署演示系统,整理项目展示材料
主要收获
高精度检测
验证准确率达到98.75%,三集平均98.56%
工程取舍
将线上能力收束为更稳定的Human/AI二分类
学术贡献
构建了大规模中文AI文本数据集
实用价值
系统可用于实际场景检测
能力提升
技术能力
- 深度学习模型设计与训练
- 自然语言处理技术应用
- 大规模数据处理与分析
- 模型优化与部署
- Python工程化开发
软技能
- 科研问题分析与解决
- 学术论文写作
- 项目规划与时间管理
- 文献调研与总结
- 实验设计与结果分析
项目结论
这一部分对应“结论”:既说明完成了什么,也说明为什么当前取舍是合理的。
系统层面
项目完成了从数据构建、模型训练、评估验证到 FastAPI 后端和 Next.js 前端演示的完整闭环,不只是离线实验脚本。
模型层面
bert_v11c_boundary_fix 在 Human / AI 二分类主任务上达到 98.56% 三集平均准确率,当前线上采用稳定的二分类输出。
方法层面
效果提升主要来自数据治理、弱域增补、长文修复和置信度校准,说明本项目不是简单堆模型,而是围绕误差来源持续优化。
边界层面
混合文本和 token 级边界检测已经做过探索,但真实场景支撑不足,因此当前作为扩展实验保留,不强行进入线上主链路。
未来展望
多语言扩展
将检测能力扩展到英文、日文等其他语言
模型轻量化
进一步优化模型,支持移动端部署
实时检测API
开发公开API服务,供研究者和开发者使用
致谢
指导教师符立梅
感谢其在选题、方法和论文写作上的指导
实验室同学
感谢同学们在实验过程中的帮助和讨论
开源社区
感谢Hugging Face等开源社区提供的工具和模型
标注团队
感谢参与数据标注的同学们
最后,感谢所有在这段旅程中给予我帮助和支持的人。这段经历将成为我人生中宝贵的财富。