徐华凤
← 全部作品
竞赛作品

特医食品数据分析(泰迪杯)

泰迪杯 B 题:用 Python 批量解析国食注字 PDF,抽取营养成分与适用人群,完成统计可视化与选品筛选。

我的角色:数据分析:PDF 批量抽取、字段清洗、适用人群归类、可视化与产品筛选逻辑。

  • Python
  • pdfplumber
  • 可视化
  • Pandas
  • 泰迪杯
结论

把特医食品 PDF 说明书变成结构化数据,并从登记趋势、人群分布、成分等维度支撑选品。

  • 泰迪杯 B 题赛题特医食品
  • 182 份 PDF数据国食注字说明书
  • 二等奖成绩数据分析技能赛
链路
  1. PDF 抽表
  2. 人群归类
  3. 可视化
  4. 选品筛选

阅读视角

同一案例,可从两种工作视角阅读重点

  • 核心:非结构化 PDF → 结构化表,含异常日志与抽检。
  • 交付:趋势 / 结构 / 成分分布 + 可筛产品,而不只是出图。
  • 边界:赛题样本不等于全市场;结论带局限与验证方式。

核心发现

  • PDF 版式差异是主要难点

    部分文件缺表头、列数不齐;用日志与跳过规则保证批量跑通,并对结果抽检。

    对异常样例单独复核,避免静默错误进入下游表。

  • 婴配类占登记主体

    旭日图显示特医婴配食品在样本中占比最高,1 岁以上品类结构更分散。

    选品时先按人群类别收窄,再按症状关键词过滤。

分析图库

不同登记年份与产品来源的获批量趋势

不同登记年份与产品来源的获批量趋势

说明 2018 年后获批量明显上升,进口与国产来源并存。

局限 仅赛题样本时间窗,不代表全市场增速。

下一步 业务选品时应用最新注册库按同一口径复算趋势。

选品筛选

赛题脱敏样本 · 按人群类别与症状关键词过滤

加载中…

产品 注册证号 人群类别 症状/适用

案例说明

背景

特殊医学用途配方食品的注册信息分散在大量 国食注字 系列 PDF 说明书中,版式不统一。第七届泰迪杯 B 题要求:将 PDF 转为结构化表 → 统计可视化 → 按人群/症状筛选产品。

我做了什么

  1. 抽取清洗:用 pdfplumber 抽取营养成分表与适用人群,再清洗归类。
  2. 统计可视化:Matplotlib 产出获批量趋势、旭日图、类别柱状、成分分布与词云。
  3. 选品筛选:按适用人群类别与症状关键词筛选候选产品(见上方选品筛选)。

局限

PDF 抽取无法完全自动化;赛题样本不等于全市场;页内选品演示为脱敏样本子集。

泰迪杯比赛项目;PDF 为赛题/公开注册信息材料,与实习公司业务无关。