← 全部作品
特医食品数据分析(泰迪杯)
泰迪杯 B 题:用 Python 批量解析国食注字 PDF,抽取营养成分与适用人群,完成统计可视化与选品筛选。
我的角色:数据分析:PDF 批量抽取、字段清洗、适用人群归类、可视化与产品筛选逻辑。
结论
把特医食品 PDF 说明书变成结构化数据,并从登记趋势、人群分布、成分等维度支撑选品。
- 泰迪杯 B 题赛题特医食品
- 182 份 PDF数据国食注字说明书
- 二等奖成绩数据分析技能赛
链路
- PDF 抽表
- 人群归类
- 可视化
- 选品筛选
阅读视角
同一案例,可从两种工作视角阅读重点
- 核心:非结构化 PDF → 结构化表,含异常日志与抽检。
- 交付:趋势 / 结构 / 成分分布 + 可筛产品,而不只是出图。
- 边界:赛题样本不等于全市场;结论带局限与验证方式。
- 闭环:抽取 → 清洗 → 可视化 → 选品筛选,页内可演示。
- 人机分工:脚本提速批量处理,版式异常靠规则与人工抽检。
- 价值:从说明书文本到「按人群/症状给出候选」的决策辅助。
核心发现
-
PDF 版式差异是主要难点
部分文件缺表头、列数不齐;用日志与跳过规则保证批量跑通,并对结果抽检。
对异常样例单独复核,避免静默错误进入下游表。
-
婴配类占登记主体
旭日图显示特医婴配食品在样本中占比最高,1 岁以上品类结构更分散。
选品时先按人群类别收窄,再按症状关键词过滤。
分析图库
不同登记年份与产品来源的获批量趋势
说明 2018 年后获批量明显上升,进口与国产来源并存。
局限 仅赛题样本时间窗,不代表全市场增速。
下一步 业务选品时应用最新注册库按同一口径复算趋势。
第七届泰迪杯数据挖掘挑战赛 B 题 · 特医食品方向 · 二等奖
选品筛选
赛题脱敏样本 · 按人群类别与症状关键词过滤
加载中…
| 产品 | 注册证号 | 人群类别 | 症状/适用 |
|---|
案例说明
背景
特殊医学用途配方食品的注册信息分散在大量 国食注字 系列 PDF 说明书中,版式不统一。第七届泰迪杯 B 题要求:将 PDF 转为结构化表 → 统计可视化 → 按人群/症状筛选产品。
我做了什么
- 抽取清洗:用 pdfplumber 抽取营养成分表与适用人群,再清洗归类。
- 统计可视化:Matplotlib 产出获批量趋势、旭日图、类别柱状、成分分布与词云。
- 选品筛选:按适用人群类别与症状关键词筛选候选产品(见上方选品筛选)。
局限
PDF 抽取无法完全自动化;赛题样本不等于全市场;页内选品演示为脱敏样本子集。
泰迪杯比赛项目;PDF 为赛题/公开注册信息材料,与实习公司业务无关。