DeepInsight 系列 04:数据集可视化先回答数据是否可用
数据集实时可视化页负责处理用户上传的数据文件。它不是训练入口,而是数据检查入口:文件能否上传,字段能否解析,样本是否正常,缺失值和分布是否可见,图表能否辅助理解数据结构。

模块定位
推荐系统评估依赖数据质量。数据格式混乱、字段缺失或样本异常时,直接进入模型训练和指标分析没有意义。DeepInsight 把数据集页面放在性能看板之前,就是为了先回答“这份数据能不能看懂”。
最终报告中也强调,上传数据集当前主要进入预览和基线评估流程,不自动触发全部深度模型重新训练。这个边界可以避免用户误以为上传一个文件就完成了完整训练。
上传流程
页面支持 CSV 和 ZIP 等文件类型。CSV 文件进入字段解析、样本预览、统计摘要和图表选择流程;ZIP 文件进入压缩包条目统计,展示文件结构和大小分布。
前端负责文件选择、上传进度、字段选择和图表配置。后端负责保存上传记录、解析列名、读取样本行并返回结构化摘要。两边的职责分开后,页面可以展示数据状态,而不是只显示上传成功。
字段与样本
数据预览是这个页面的基础。用户需要先看到列名、样本行、字段类型和缺失情况,才能判断后续图表是否有意义。对于推荐系统数据,用户、物品、时间、评分或行为字段都可能影响分析方式。
如果字段无法识别,页面应该给出提示,而不是强行生成图表。错误的数据结构会让可视化结果看起来完整,但实际没有解释价值。
图表分析
CSV 数据可以生成表格、直方图、散点图、相关性热力图和 PCA 投影视图。这些图表用于观察分布、异常值、字段关系和样本结构。
图表结果只能说明上传数据本身,不能直接说明模型效果。模型效果仍然需要由评估记录、日志或后续任务产生。这个边界在博客中必须写清楚,否则数据可视化会被误读成性能评估。
数据记录
后台会保存上传数据集的摘要信息,便于后续在管理员页面查看。前台负责用户操作和预览,后台负责数据资产管理和审计,两者形成对应关系。
后续如果扩展异步离线评估,可以把上传记录、评估任务、指标结果和模型版本串起来。当前阶段先把上传、解析、预览和统计做好,是更稳的实现顺序。
异常处理
数据集页面需要处理文件过大、格式不支持、字段为空、解析失败和图表无法生成等情况。异常提示应说明失败位置,而不是简单给出“上传失败”。
对课程项目来说,异常状态同样是实现结果的一部分。它说明系统不仅考虑成功路径,也考虑了用户上传真实文件时可能遇到的问题。
阶段结论
数据集实时可视化页解决的是数据入口问题。它让用户在进入性能看板之前先检查数据结构,并通过图表理解样本特征。这个页面的核心不是炫图表,而是把数据能否被理解这件事讲清楚。