信息速览
INFOBOX — CAMELYON17 一屏速览
维度 内容 本质 ISBI 2017(墨尔本)病理 grand challenge 第二届:乳腺癌淋巴结转移患者级 pN 五类分期挑战赛,配套数据集经 GigaScience/GigaDB 永久公开 组织方 Radboud University Medical Center(RUMC,van der Laak / Litjens / Karssemeijer)+ University Medical Center Utrecht(UMCU,van Diest) 两篇论文 数据论文:GigaScience 7(6) 2018,doi:10.1093/gigascience/giy065(Litjens 等)|挑战赛总结:IEEE TMI,doi:10.1109/TMI.2018.2867350(Bandi 等) 数据 5 家荷兰医院 × 各 100 患者 × 1-5 张 WSI:挑战赛发放 1000 张,GigaScience 存档 1399 张(2.95 TB);TIFF + slide 级 XML 注释 任务 两步管线:slide 级转移检测 → 患者级 pN 分期,五类 pN0 / pN0(i+) / pN1mi / pN1 / pN2 指标 五类 quadratic weighted Cohen’s kappa;平局按 pN2→pN0 逆序单类 kappa 逐一破解 参赛规模 23 支队伍 / 37 个算法;kappa 极差 0.89 ~ -0.13;单人最佳 76/100 患者分期正确 冠军 正式阶段 Lunit(首尔)kappa 0.8993(IEEE-TMI Table I);Deep Bio 会后补交阶段宣称 0.9570(新闻稿口径,见坑 5) 组合上限 多算法融合 kappa 0.9261、77/100——比最强单体只多对 1 个患者 失败模式 ITC 识别率 <40%(最佳算法仅 11.4%);微转移漏检是 pN0(i+)/pN1mi 混淆主因 许可 挑战期 CC BY-NC-ND 4.0 → 现行 CC0 1.0(官网+GigaDB+AWS 三源一致) 获取 GigaDB(doi:10.5524/100505)/ Google Drive / Baidu Pan / AWS S3 s3://camelyon-dataset/ 官网注册,共五渠道库内互链 camelyon16(rid 694,前作)、camelyon16-17(rid 33,旧版合并条目)、pcam(158)、panda(560)等
CAMELYON17 是一次"把病理 AI 从切片推到病人"的集体实验:它的前作 CAMELYON16 只要求模型回答"这一张切片里有没有转移",而它要求模型面对同一位病人的全部切片回答"这位病人的 pN 分期是哪一档"——这正是外科医生决定要不要做腋窝清扫时面对的问题。结果显示,切片级检测已接近人类专家(前作成绩),而把几十张切片聚合成一个分期决定时,23 支队伍 37 个算法的 kappa 从 0.89 一路掉到 -0.13;卡住所有人的不是大转移,而是比癌细胞团大不了多少的孤立肿瘤细胞。
导语读法三则:
- 只想下数据:直奔 §5 获取与许可——现行 CC0 1.0,GigaDB/GDrive/Baidu/AWS 四条直链,注册官网是第五条。
- 关心任务与指标:直奔 §3 与 §4——两步管线与 quadratic weighted kappa 的设计动机,评测前必须读懂平局破解规则。
- 做算法对比:直奔 §7 排行榜——注意 IEEE-TMI 正式阶段口径与会后补交口径(Deep Bio 0.9570)是两套体系,别混着引(坑 5)。
§0 导读:这个数据集解决什么问题
乳腺癌淋巴结状态(pN 分期)是 TNM 分期的核心变量之一,直接决定辅助治疗强度。临床金标准是病理医生在显微镜下逐张检查前哨/腋窝淋巴结切片——一名患者的切除标本可产生 1-5 张全切片,大转移(>2mm)容易发现,但微转移(0.2-2mm)与孤立肿瘤细胞(ITC,≤0.2mm)需要在不同切面反复寻找,阅片量大、疲劳漏检率高。文献反复报道:额外切面与免疫组化能把 pN0 患者中的隐匿转移检出率提高两位数百分点,即标准人工阅片本身就是一个有系统性漏检的"金标准"。
CAMELYON16(2016,ISBI)迈出第一步:给模型一张 WSI,让它输出"阴性还是转移",本质是 slide 级二分类。RUMC 与 UMCU 团队在总结中发现两个遗留问题:其一,slide 级二分类在临床决策中只是中间步骤——外科真正需要的是患者级分期;其二,16 的标签把微转移与 ITC 合并处理,抹掉了临床上最微妙也最影响预后的分层。于是 CAMELYON17(ISBI 2017,墨尔本)把任务升级为:给定一位患者的全部 WSI,输出该患者的 pN 五类分期,并按临床口径把 pN0(i+)(仅 ITC)与 pN1mi(微转移)单列。这一步把任务从"模式识别"推向"证据聚合":模型必须先在每张切片上找转移,再把跨切片的证据按 AJCC 规则聚合成分期决定——这正是多示例学习(MIL)在病理影像落地的第一批公开考场之一。
数据的工程化同样关键:5 家荷兰医院、3 款扫描仪、1000 张发放切片,全部 slide 级注释由 2 名资深病理学家复核、病理主任终审,XML 格式公开 macro/micro 双层分割多边形。挑战赛后,数据经 GigaScience 数据论文(2018)以 CC0 1.0 永久归档,成为病理弱监督/MIL 研究的标准弹药库之一,其 patch 化衍生品 PCam 的引用量甚至超过了本尊。
§0 读法三则:
- 这个条目是"挑战赛+数据集"双实体:挑战赛(2017 年 4 月截止)与数据集(GigaScience 2018 归档、现行 CC0)是两个生命周期,获取与许可一律以数据集生命周期为准。
- 全文统计数字均出自 IEEE-TMI 总结论文(Table I 口径)与 GigaScience 数据论文(Table 1-6 口径);两处口径分歧(1000 vs 1399 张)已在坑 3 存照。
- 检索时若把"CAMELYON17"当成 2018 年的活动去搜会错过主线——挑战赛挂靠 ISBI 2017(墨尔本,2017-04-18/21),总结论文 2018-2019 年才发表(坑 2)。
§1 数据集速览:十问十答
Q1:CAMELYON17 到底是比赛还是数据集?
两者都是,但生命周期不同。挑战赛:2016-11-10 网站上线,2017-04-01 算法截稿,ISBI 2017(墨尔本)现场公布成绩,会后提交开放至 2017-12-31。数据集:2018 年经 GigaScience 数据论文永久归档(GigaDB doi:10.5524/100505),现行许可 CC0 1.0,任何人可直接下载——今天你接触到的实体是后者。
Q2:任务到底是什么?
给定一位患者的全部 WSI(1-5 张),输出该患者的 pN 分期,五类:pN0(无转移)、pN0(i+)(仅有孤立肿瘤细胞 ITC)、pN1mi(有微转移)、pN1、pN2。官方鼓励两步输出:每张切片的转移概率热图 + 患者级分期标签。
Q3:pN0(i+) 和 pN1mi 有什么区别?
大小。ITC 指转移灶最大径 ≤0.2mm(或单个切面 ≤200 个肿瘤细胞);微转移指 >0.2mm 且 ≤2mm;超过 2mm 为宏转移。pN0(i+) 表示淋巴结里只有 ITC 级别病灶,pN1mi 表示至少有一个淋巴结存在微转移。这两档在临床上对应不同的治疗决策,也是全体参赛算法的共同滑铁卢(§7.4)。
Q4:数据有多少、长什么样?
5 家荷兰医院各贡献约 100 名淋巴结切除患者(训练 100 + 测试 100,共 200 名患者),每人 1-5 张 H&E WSI。挑战赛发放口径 1000 张;GigaScience 存档口径 1399 张(含患者间全部切片,2.95 TB)。TIFF 格式(超 4GB 用 bigTIFF),512px tile,0.23-0.25 μm/px,JPEG 压缩,RGB 8-bit。
Q5:谁标注的,标注了什么?
slide 级:转移区域由资深标注者勾画、2 名经验丰富的病理学家复核(分属 RUMC 与 LPON),经病理主任终审;XML 格式公开 macro/micro 双层分割多边形,另含 50 张 lesion 级细注释(每中心 10 张)。患者级:pN 标签来自病理报告与复核流程,训练集 100 名患者的 pN 分布为 pN0 25 / pN0(i+) 11 / pN1mi 21 / pN1 30 / pN2 13;测试集标签未公开。
Q6:许可是什么?我现在能用吗?
现行许可 CC0 1.0——官网 Data 页、GigaDB record、AWS Open Data 三源一致,可以商用、无需署名(但学术礼仪上仍应引用两篇论文)。注意挑战期(2016-2017)许可曾是 CC BY-NC-ND 4.0,旧教程与部分转载页面仍写旧许可(坑 4)。
Q7:比赛谁赢了?
会前正式阶段冠军是首尔的 Lunit,quadratic weighted kappa 0.8993(IEEE-TMI Table I 十二强之首,第二名 HMS-MGH-CCDS 0.8806)。会后补交阶段,另一家首尔公司 Deep Bio 宣称 kappa 0.9570 居首——但该轮未被 IEEE-TMI 总结论文收录,属新闻稿口径(坑 5)。
Q8:算法们共同失败在哪?
ITC。总结论文报告全部 37 个算法对 ITC 的识别率不足 40%,最佳算法仅 11.4%。ITC 漏检导致 pN0 与 pN0(i+) 混淆、微转移漏检导致 pN0(i+) 与 pN1mi 混淆——分级越细、错误越靠低端聚集。kappa 极差 0.89 ~ -0.13 也说明弱标签聚合阶段各家策略差异极大。
Q9:和 CAMELYON16 什么关系?
同一组织方、同一 5 家医院体系的直接前作。C16 是 slide 级二分类(阴性 vs 含转移,270 train + 130 test WSI,单中心扫描为主);C17 升级为患者级五类分期(1000 WSI,200 患者,3 款扫描仪)。两者数据不重叠、任务不可互换——在 C16 上验证过的模型不能直接拿 C17 排行(坑 8)。本库两条目互链但内容各自独立(§9)。
Q10:为什么它对 AI-Ready 重要?
它是"原始 TIFF + 标准 XML + 患者级标签"的中高结构化样本:全片可按 tile 流式读取,XML 注释可直接转 mask 训练 slide 级检测,pN 标签自带临床语义;短板是无现成 tile 化训练包(要自己切)、测试标签不公开(要跑官方服务器)。CC0 许可把法律门槛降到零,五条下载渠道把网络门槛也压到很低。
§1.5 任务一图流(文字版)
从一个患者走进手术室开始,CAMELYON17 的数据与任务链条如下:
乳腺癌手术
└─ 前哨/腋窝淋巴结切除(患者 = 一个标本,1 到多个淋巴结)
└─ 每个淋巴结常规取材 → H&E 切片 → 扫描
└─ 1-5 张 WSI / 患者(TIFF, 0.23-0.25 μm/px)
└─ 病理标注:转移灶多边形(XML: Macro/Micro 层)
└─ 患者级聚合 → pN 分期(五类之一)
├─ pN0 所有淋巴结阴性
├─ pN0(i+) 仅 ITC(≤0.2mm)
├─ pN1mi 有微转移(0.2-2mm)
├─ pN1 1-3 个阳性淋巴结
└─ pN2 ≥4 个阳性淋巴结
└─ 临床决策:辅助治疗强度 / 是否腋窝清扫
算法要接管的正是最后两级:从 WSI 到 pN。链条中每一环(切片厚度、切面运气、标注者经验、ITC 的成像极限)都会传导到最终分数——理解这条链,比记住任何一排名次都更接近这个数据集的设计本意。
§2 数据构成与规格
2.1 五家医院:例数与扫描仪
CAMELYON17 的数据采集网络由 5 家荷兰医院组成,每家提供约 100-170 例淋巴结切除标本用于训练/测试抽取(多余例数用于替换与质控):
| 中心 | 全称 | 可用例数 | 扫描仪 | 角色 |
|---|---|---|---|---|
| RUMC | Radboud University Medical Center(奈梅亨) | 130 | 3DHistech Pannoramic Flash II 250 | 组织方兼数据中心 |
| CWZ | Catharina Ziekenhuis(埃因霍温) | 144 | 3DHistech Pannoramic Flash II 250 | 数据中心 |
| UMCU | University Medical Center Utrecht(乌得勒支) | 129 | Hamamatsu NanoZoomer-XR C12000-01 | 组织方兼数据中心 |
| RST | Rijnstate(阿纳姆) | 168 | 3DHistech Pannoramic Flash II 250 | 数据中心 |
| LPON | Laboratorium Pathologie Oost-Nederland(亨格洛) | 140 | Philips Ultrafast | 数据中心(病理复核方之一) |
每个中心贡献 100 名训练患者 + 100 名测试患者中的约 20 + 20 名,形成"每中心都有代表"的均衡设计。三款扫描仪覆盖了当年主流的三条技术路线(3DHistech 的条带扫描、Hamamatsu 与 Philips 的线扫描),这个刻意安排的异构性在 §8.3 有专门讨论。
2.2 规模:两个口径并存(坑 3 预告)
| 口径 | 数字 | 出处 |
|---|---|---|
| 挑战赛发放 | 1000 张 WSI(500 训练 + 500 测试) | 官网 Data/Evaluation 页 |
| GigaScience 存档 | 1399 张 WSI,2.95 TB | GigaScience 论文标题与正文 |
| IEEE-TMI 记录 | C17 数据 2314.6 GB;CAMELYON 全项目(C16+C17)3030.5 GB | IEEE-TMI 总结论文 |
三个数字并不矛盾:患者级聚合口径下 200 名患者 × 平均 5 张切片 = 1000 张进入挑战赛发放流程;GigaScience 归档时把每名患者的全部切片收入(含用于分期的补充切面),得到 1399 张;TB 差异(2.95 vs 2.31)源于归档范围与压缩口径不同。引用时必须声明口径——"1000 张"指挑战任务发放集,"1399 张"指完整归档。
2.3 图像格式规格
| 属性 | 规格 |
|---|---|
| 染色 | H&E |
| 容器格式 | TIFF(文件超 4GB 时为 bigTIFF) |
| tile 尺寸 | 512 × 512 px |
| 空间分辨率 | 0.23-0.25 μm/px(对应 20× 至 40× 光学放大) |
| 压缩 | JPEG(有损,tile 内) |
| 色深 | RGB 8-bit |
| 注释格式 | XML(slide 级 macro/micro 双层分割多边形) |
两处工程含义:其一,JPEG 有损压缩意味着 tile 级像素值与原始扫描存在差异,做像素级超分辨或染料定量研究时要意识到这是"扫描+压缩"双重混合域;其二,0.23-0.25 μm/px 的区间差异来自不同扫描仪的光学配置,跨中心对齐时不要假设统一倍率,应读取每张 WSI 自身的分辨率元数据。
2.4 训练侧 slide 级标签分布(GigaScience Table 4/5 口径)
500 张训练 WSI 的 slide 级标签分布:
| slide 级标签 | 含义 | 数量 | 占比 |
|---|---|---|---|
| None | 无任何转移灶 | 323 | 64.6% |
| Macro | 含宏转移(>2mm)区域 | 85 | 17.0% |
| Micro | 含微转移(0.2-2mm)区域(不含宏转移) | 57 | 11.4% |
| ITC | 仅含 ITC(≤0.2mm) | 35 | 7.0% |
| 合计 | — | 500 | 100% |
约六成半的阴性占比刻意压低了阳性密度——真实前哨淋巴结活检的阳性率通常仅两至三成,此处为训练效率做了适度富集。ITC 只占 7%,这个稀缺性直接预言了 §7.4 的集体失败。
2.5 训练侧患者级 pN 分布(100 名训练患者)
| pN 分期 | 定义要点 | 数量 |
|---|---|---|
| pN0 | 全部淋巴结无转移 | 25 |
| pN0(i+) | 仅有 ITC 级病灶(≤0.2mm) | 11 |
| pN1mi | 存在微转移(0.2-2mm) | 21 |
| pN1 | 1-3 个阳性淋巴结(含微转移计入) | 30 |
| pN2 | 4 个及以上阳性淋巴结(官网 Evaluation 口径,见坑 6) | 13 |
| 合计 | — | 100 |
五类均不塌缩:最稀少的 pN0(i+) 也有 11 名患者。与真实临床分布相比,pN2 偏多、pN0(i+) 被刻意富集——组织方明确表示类别配比经过设计,让每一档都有足够的训练信号。测试集 100 名患者的真实 pN 标签未公开(官方评测服务器持有)。
2.6 注释规格与质量链
- slide 级注释:转移区域以多边形勾画,XML 中分 macro 与 micro 两层存储,可直接转成像素级 mask 训练分割/检测模型。
- lesion 级注释:50 张 WSI(每中心 10 张)提供逐病灶细注释;CAMELYON 全项目(C16+C17)合计 209 张 WSI 有 lesion 轮廓。
- 质量链:资深标注者初标 → 2 名经验丰富的病理学家分别复核(RUMC 与 LPON 各一)→ 病理主任终审。pN 患者级标签与 slide 级注释之间的一致性由该流程保证。
- 已知噪声源:ITC 级别病灶的可视确认本身就依赖切面运气与免疫组化(临床实践中 ITC 常由 cytokeratin IHC 检出,而 H&E 上极易漏看),因此 ITC 标签是全数据集最脆弱的一层(IEEE-TMI 总结与 GigaScience 论文均明示)。
2.7 三款扫描仪异构的意义
同一场比赛里混入三个厂商的扫描器,在 2017 年是激进设计。它的直接后果:任何在单一中心数据上训练的模型都会在另两个中心遭遇颜色分布、tile 纹理与扫描伪影的域偏移;间接后果是它把"染色归一化/域自适应"变成了 CAMELYON17 论文的必答题——总结论文中排位靠前的队伍普遍使用了某种形式的颜色增强或归一化。对今天的使用者:把它当作免费的域泛化基准用,报告跨中心分层结果比报告全集平均更有信息量。
2.8 预处理流水线实操要点
从下载到可训练,一般要过四道工序:
- 读取与重采样:OpenSlide 逐张读 mpp 元数据,按统一物理分辨率(常用 0.5 μm/px,即约 20×)重采样;直接按固定倍率缩放会把三款扫描仪的差异进一步放大。
- 组织区域筛选:按 tile 级饱和度/亮度阈值过滤背景与伪影(Otsu 或简单 HSV 阈值即可),背景 tile 在训练中应丢弃而非作为负样本——阴性 tile 的"负例"语义由 None 标签的阳性 tile 之外的区域承担,混入纯背景会稀释 ITC/微转移的监督信号。
- 注释栅格化:XML → 像素 mask(附录 H.2),必须抽样可视化校验坐标层级;这是社区复现错误率最高的一步。
- 患者索引表:从文件名或官网清单建立 patient_id ↔ slide_id 映射表并固化——患者级任务的全部切分与聚合都依赖这张表,表错了实验全错。
四道工序之后的数据形态:tile 序列(带 slide_id/patient_id/中心标签)+ slide 级 mask(可选)+ 患者级 pN 标签。到此才谈得上 §3 的两步管线。
§3 任务定义与两步管线
3.1 任务形式化
输入:一名患者的全部 WSI(1-5 张,张数即信息——切除淋巴结越多,检出转移的概率结构越复杂)。
输出:该患者的 pN 分期,五类之一:pN0 / pN0(i+) / pN1mi / pN1 / pN2。
辅助输出(鼓励但非强制):每张 WSI 的转移概率热图。
组织方在官方文档中明示了两步参考管线:第一步 slide 级——对每张 WSI 检测并分割转移区域,输出概率热图;第二步患者级——把全部切片的检测结果按 pN 规则聚合成五类分期。这不是唯一路径(端到端模型也可以直接吃全切片堆栈输出分期),但评测只看患者级五类结果。
3.2 pN 聚合规则的陷阱
把 slide 级检测结果聚合成 pN 分期,比看上去难得多:
- ITC 与 pN0(i+) 的纠缠:一个仅含 ITC 的患者应判 pN0(i+) 而非 pN0——但 ITC 在 H&E 上与淋巴细胞团几乎同貌,检测器的阈值摆动直接决定这两类的边界。
- 微转移的跨切面问题:一个 0.25mm 的转移灶在一张切片上可能只表现为几个腺体——切面没切到它就是 pN0(i+),切到了就是 pN1mi;模型没有"多切面物理采样"的概念,只能靠概率。
- 计数规则:pN1 与 pN2 的边界是"阳性淋巴结数量"(3 vs 4),要求模型先做 slide 级阳性判断、再做患者内计数——计数错误是 pN1↔pN2 混淆的主要来源。
- 顺序依赖:quadratic weighted kappa 把相邻类错误(pN0↔pN0(i+))罚得轻、隔类错误(pN0↔pN2)罚得重,这逼着算法优先保住"大体方向"而非精修个别样本。
3.3 与 CAMELYON16 的任务差异
| 维度 | CAMELYON16 | CAMELYON17 |
|---|---|---|
| 任务层级 | slide 级二分类(阴性 vs 转移) | 患者级五类分期 |
| 类别粒度 | 转移合并(macro+micro+ITC 一类) | pN0/pN0(i+)/pN1mi/pN1/pN2 |
| 数据量 | 400 WSI(270 train + 130 test) | 1000 WSI 发放(1399 归档) |
| 患者数 | 110 名患者(前哨) | 200 名患者 |
| 扫描仪 | 2 款(Hamamatsu / Philips) | 3 款(3DHistech / Hamamatsu / Philips) |
| 指标 | slide 级 ROC AUC / FROC | 患者级 quadratic weighted kappa |
| 临床映射 | “切片里有没有转移” | “这个病人要不要腋窝清扫” |
两代任务的关系是"检测→分期"的流水线升级:C16 证明 slide 级检测可以做到接近专家(AUC 0.99 级),C17 证明"把检测聚合成临床决定"才是真正的鸿沟。本库 camelyon16 条目(rid 694)对 C16 细节有完整叙述,此处不重复。
3.4 两步路线与端到端路线
官方推荐的两步管线(检测→聚合)与端到端路线(全片堆栈直接出分期)在挑战赛中并存,总结论文观察到的格局是:两步路线仍是十二强的主流,原因有三——检测目标(转移灶)有明确标注监督,直接可学;聚合规则的临床语义清晰,可人工编码;概率热图作为辅助输出让错误可归因。端到端路线的优势在于聚合阈值不用手工调、跨切片交互可被注意力机制隐式建模,但缺乏病灶级监督使其在 ITC 这类小目标上更吃亏。这一格局在后来的病理分级任务(PANDA)中重演:检测/分割打底 + 规则或注意力聚合,至今仍是弱监督病理的主流形态。
3.5 临床映射:为什么 pN 这么重要
pN 是 TNM 分期中 N 的病理学版本。乳腺癌中,淋巴结状态直接影响:是否需要腋窝淋巴结清扫(pN2 级别的负荷通常意味着清扫获益)、辅助化疗强度的选择、以及预后分层。pN0(i+) 与 pN1mi 这两个"亚临床"档位在指南中的处理建议仍在演化(ITC 是否清扫、微转移是否加放疗存在流派差异),因此把它们单列成类既是临床忠实度,也是对算法的诚实考验——一个把 pN0(i+) 和 pN0 混为一谈的模型,在真实门诊里会改变治疗决策。
§4 评价协议:quadratic weighted kappa 及其细则
4.1 为什么不用 accuracy
五类有序分类 + 类别不平衡(测试集 pN 分布接近训练集设计),accuracy 会被多数类主导:一个永远输出 pN1 的算法在 pN1 占 30% 的分布下就能拿 30% 基线分,而它对临床毫无用处。quadratic weighted Cohen’s kappa 同时校正了随机一致性与错误距离:两个预测不一致时,偏离真实类别越远扣分越多。对五类 pN 而言,"把 pN2 说成 pN0"的代价是"把 pN0 说成 pN0(i+)"的 16 倍(权重 4² vs 1²),这个设计强迫算法在"高分期漏检"上格外小心——恰好对应临床后果最严重的方向。
4.2 正式指标与平局破解
- 主指标:五类 quadratic weighted Cohen’s kappa(对 100 名测试患者的 pN 预测 vs 真实 pN)。
- 平局破解:kappa 相同的两支队伍,按 pN2 → pN0 的逆序依次比较单类 kappa(先比 pN2 类的二值化 kappa,再比 pN1,依次向 pN0 退)——即"谁对更严重分期的识别更好谁赢"。
- 提交格式:每名测试患者一行,pN 预测类别;评测由官方服务器自动运行,测试标签全程不对参赛者公开。
- 阶段划分:会前正式阶段(2017-04-01 截稿,ISBI 2017 公布,IEEE-TMI 论文统计口径)与会后开放阶段(2017-05-15 重开至 2017-12-31,排行榜继续运行但未进入 TMI 论文)。
4.3 提交格式与评测实操
会前正式阶段的提交为患者级结果文件(每名测试患者一行的 pN 预测),由官方评测服务器计算 kappa;挑战赛年代允许结果文件上传,平台后续改版为容器化算法提交(现行以官网 Evaluation 页指引为准,见附录 W)。两条实操纪律:其一,评测服务器对提交次数有限制,把验证迭代放在训练集内部分割上(按患者切,Q24),服务器只用于终验;其二,测试集 500 张 WSI 的读取顺序与患者-切片映射以官网清单为准,自行猜测映射关系是常见的低级翻车点。
4.4 协议设计的两个遗产
其一,"聚合指标 + 距离加权"的组合此后成为病理分级类挑战赛的标准配置——PANDA(前列腺 Gleason 分级,ISBI 2020/Kaggle)直接沿用了 quadratic weighted kappa 作为主指标,本库 panda(rid 560)条目对此有延续叙述。其二,"测试标签永不公开、评测服务器常驻"的模式在 grand-challenge.org 平台上固化为基础设施——今天该平台的 archive 与 evaluation 页面仍以同一套逻辑运行,CAMELYON17 是早期范本之一。
§5 获取与许可:五个门怎么进
5.1 许可演变链(引用前必读)
| 时期 | 许可 | 出处 |
|---|---|---|
| 挑战期(2016-2017) | CC BY-NC-ND 4.0 | GigaScience 论文附录存照(原挑战协议文本) |
| 数据论文发布(2018)至今 | CC0 1.0 | 官网 Data 页 + GigaDB record 100505 + AWS Open Data 三源一致 |
这条演变链的含义:2018 年数据论文正式发表时,组织方把许可从"署名-非商业-禁止演绎"改判为公有领域贡献(CC0)。因此任何 2018 年之前的第三方教程、博客或转载页面若标注 CC BY-NC-ND,都反映的是历史状态而非现行状态;今天的使用者按 CC0 处理即可——可以商用、可以衍生、无需申请。学术礼仪上仍建议引用 GigaScience 数据论文与 IEEE-TMI 总结论文(§5.5)。
5.2 五条下载渠道
| 渠道 | 入口 | 特点 |
|---|---|---|
| ① GigaDB | doi:10.5524/100505(record 100505) | 学术归档,与数据论文绑定,文件校验和齐全,最稳定 |
| ② Google Drive | 官网 Data 页链接 | 直链快,适合单文件补拉 |
| ③ Baidu Pan | 官网 Data 页链接 | 中国大陆网络环境首选 |
| ④ AWS S3 | s3://camelyon-dataset(us-east-1,AWS Open Data 计划) |
命令行批量下载与云端训练流水线首选,无需注册 |
| ⑤ 官网注册 | camelyon17.grand-challenge.org → Data | 注册账号后下载;同时可访问官方评测服务器 |
实操建议:脚本化批量训练用 AWS S3(aws s3 sync 即可),单次研究复现用 GigaDB(校验和可靠),国内网络用 Baidu Pan。注意官网子页面路径首字母大写(/Data/、/Evaluation/),小写路径会 404(坑 7)。
5.3 AI-Ready 评估
| 维度 | 评级 | 说明 |
|---|---|---|
| 可发现性 Discoverability | 高 | DOI + 官网 + AWS Open Data + 两篇论文互指,检索饱和 |
| 可访问性 Accessibility | 高 | CC0 无门槛;五渠道含对象存储直链;唯一门槛是测试标签不公开 |
| 互操作性 Interoperability | 中高 | TIFF 标准 tile 结构,OpenSlide/tifffile 直接可读;XML 注释需自行转 mask(无现成转换包) |
| 元数据 Metadata | 中高 | 患者级 pN 标签 + slide 级标签表齐全;扫描仪/分辨率元数据在 WSI 头内;无统一数据字典发布 |
| 可持续性 Sustainability | 高 | GigaDB 学术归档 + AWS Open Data 常驻,双重长期保存 |
综合:中高结构化的 AI-Ready 数据集。原始 TIFF + 标准 XML + 患者 pN 标签让"下载即训练 slide 级检测/患者级分期"成为可能,但没有现成 tile 化包(PCam 那种即插即用 patch 集不存在于此条目),做患者级实验需要自己写聚合逻辑——这部分工程成本恰是数据集的设计意图之一。
库内光谱定位见附录 AQ;五维逐项证据见附录 B(DAIMS 全表)。
5.4 下载实操速查
# 渠道 ④ AWS S3(无需注册,us-east-1,AWS Open Data 计划)
aws s3 sync s3://camelyon-dataset ./camelyon17/ --no-sign-request
# 渠道 ① GigaDB(学术归档,含校验和)
# 访问 https://doi.org/10.5524/100505 → 数据文件列表 → wget/aria2
# 下载后核对 md5/sha256(GigaDB record 页提供校验文件)
# 渠道 ⑤ 官网(需注册;注意子页路径首字母大写)
# https://camelyon17.grand-challenge.org/Data/
存储预算提示:完整归档 2.95 TB,确保磁盘与带宽;只需要训练侧时可先只拉训练 500 张(约 1.4 TB 量级)做原型,测试侧 500 张在终验前再拉。
5.5 引用要求(学术礼仪与许可条款的差别)
CC0 不强制署名,但正常引用应包含:① GigaScience 数据论文(Litjens et al. 2018,doi:10.1093/gigascience/giy065)——数据出处;② IEEE-TMI 挑战赛总结论文(Bandi et al., doi:10.1109/TMI.2018.2867350)——若引用挑战赛结果或排行榜;③ 使用测试集评测分数时注明"官方评测服务器口径"。只引数据论文不引总结论文是文献中的高频不完整引用——排行榜数字全部出自后者。
§6 数据论文与时间线(GigaScience 视角)
6.1 数据论文本身
Litjens 等 2018 年发表于 GigaScience 7(6) 的数据描述论文(doi:10.1093/gigascience/giy065,PMCID PMC6007545)是数据集的正式档案:论文标题里的"1399 H&E-stained whole slide images"即归档口径;正文 Table 1-6 完整给出中心例数、slide 标签分布、患者 pN 分布与格式参数(本条目 §2 的表格数字全部转引自此)。论文开放获取,与 GigaDB record 100505 互为表里——论文描述数据、GigaDB 持有数据,这套"数据论文+归档库"组合是 GigaScience 生态的标准动作,也是数据集可持续性的制度保证。
6.2 伦理与隐私
数据采集经伦理审查,批号在 GigaScience 论文中登记为 NL48845.091.16(另一处文件写作 2016-2761,两个编号的对应关系存照待并核,见坑 9 存照说明——实为同一审查的两个记录口径)。数据以全切片形式提供,患者身份信息未随数据发布;官网与数据论文均未附面部/临床表格等二次标识信息。使用者做回顾性研究时按所在机构伦理要求自查,数据本身按 CC0 流转。
6.3 完整时间线
| 日期 | 事件 |
|---|---|
| 2016-11-10 | 挑战赛网站上线 |
| 2016-11-18 | 开放注册,发布首批训练数据(2 中心) |
| 2016-12-18 | 发布第二批训练数据(5 中心齐全,500 训练 WSI) |
| 2017-03-01 | 测试集发布(500 WSI,标签不公开) |
| 2017-04-01 | 会前正式阶段算法截稿 |
| 2017-04-18/21 | ISBI 2017(墨尔本)现场公布成绩,冠军 Lunit kappa 0.8993 |
| 2017-05-15 | 会后提交重开(排行榜继续运行) |
| 2017-12-31 | 会后提交截止 |
| 2018 | GigaScience 数据论文发表(giy065),数据改判 CC0 1.0 归档 GigaDB |
| 2018-2019 | IEEE-TMI 挑战赛总结论文在线/正式发表(DOI 10.1109/TMI.2018.2867350) |
时间线读法两则:其一,训练数据的分批释放(2016-11 两中心 → 2016-12 五中心)意味着早期参赛者在数据量上吃过亏——复现早期方法时注意其训练配置对应的批次时点;其二,测试发布(2017-03-01)与截稿(2017-04-01)只有一个月,这个窗口短得足以排除"在测试集上迭代"的可能,是挑战赛协议严谨性的体现,也是为什么官方排行榜至今仍有公信力。
6.4 与数据论文配套的长期影响
GigaScience 归档把 CAMELYON17 从"挑战赛遗物"变成"常备弹药":此后所有引用该数据的工作都可以指向一个稳定的 DOI 而不是一条会失效的官网链接。两篇论文(数据论文 + 总结论文)合计引用量超过 2000 次(2026 口径,Google Scholar 存照),其中大量引用来自 CAMELYON17 本身并未参与的工作——它作为"WSI 弱监督/MIL 标准测试床"的通用性已超过原挑战赛范畴。patch 化衍生品 PCam(本库 rid 158)从 CAMELYON16 采样而来,但其论文与生态常与 C17 数据并列引用,构成 CAMELYON 家族的"全片-补丁"两用光谱。
6.5 与 CAMELYON16 数据口径的对照
| 维度 | C16(2016) | C17(2018 归档) |
|---|---|---|
| 数据论文 | 数据论文随挑战赛总结发表(GigaScience 2016 短文口径) | 独立数据描述论文(giy065,Table 1-6 完整档案) |
| 归档库 | 数据经官网与镜像分发为主 | GigaDB 正式归档(DOI 10.5524/100505) |
| 许可轨迹 | 挑战期条款延续 | 挑战期 CC BY-NC-ND → CC0 改判 |
C17 的归档制度化程度高于 C16——独立数据论文 + 正式 DOI + 许可改判三件事让它成为两代中"更 AI-Ready"的一代。做数据集归档工程的团队可以把 C16→C17 的升级当作案例:同一条数据曲线,制度投入不同,五年后的可获取性差距巨大。
§7 挑战赛结果:23 队 37 算法的成绩单
7.1 参赛规模与阶段
会前正式阶段共 23 支队伍、37 个算法提交(多支队伍提交多个版本)。评测在官方服务器上对 100 名测试患者进行,quadratic weighted kappa 排名。IEEE-TMI 总结论文(Bandi 等)收录的是会前正式阶段口径;会后开放阶段(2017-05-15 至 2017-12-31)的排行榜继续运行,成绩未进入 TMI 论文——两套口径在文献中被频繁混引(坑 5)。
7.2 正式阶段十二强(IEEE-TMI Table I 全转)
| 排名 | 队伍 | quadratic weighted kappa |
|---|---|---|
| 1 | Lunit(首尔,InsightDL 平台团队) | 0.8993 |
| 2 | HMS-MGH-CCDS | 0.8806 |
| 3 | VCA-TUe | 0.8729 |
| 4 | MIL-GPAT | 0.8567 |
| 5 | Indica Labs | 0.8554 |
| 6 | chengshenghua | 0.8439 |
| 7 | DTU | 0.8098 |
| 8 | CMT-CUHK | 0.7718 |
| 9 | destuo | 0.7640 |
| 10 | METU-VISION | 0.7599 |
| 11 | Proscia | 0.7554 |
| 12 | MI-KA | 0.7330 |
十二强之后成绩继续下滑,直到出现负值。冠军 Lunit 同时是 CAMELYON16 正式阶段榜首——同一团队两代赛事连庄,其结果说明 slide 级检测质量对患者级分期有决定性传导:检测强的队伍聚合起点就高。
从队伍构成看,十二强横跨四类组织:商业 AI 公司(Lunit、Indica Labs、Proscia)、大学实验室(HMS-MGH-CCDS、VCA-TUe、DTU、CMT-CUHK、METU-VISION)、医院/研究所联合体与个人研究者队伍(chengshenghua、MI-KA 等)。商业队伍包揽前三之外的名次分布显示:挑战赛早期,学术与商业在病理检测任务上的差距尚未拉开——这与几年后基础模型时代"实验室推动、公司放大"的格局形成有趣对照。
7.3 分布与极差:一次任务的"难度光谱"
37 个算法的 kappa 覆盖 0.89 至 -0.13——负 kappa 意味着预测比随机猜测更差,在有序分类里通常是"分期方向系统性判反"(比如把高负荷判成阴性)。这个极差本身就说明:任务难度上限由算法质量决定,而非数据缺陷;同一段数据既能考出 0.89 也能考出 -0.13,是罕见的"宽光谱"基准。单人最佳算法正确分期 76/100 名患者;把多个算法的输出做组合(IBM 与团队融合口径),kappa 可达 0.9261、正确 77/100——比最强单体只多对 1 名患者,说明错误高度重叠于同一批 ITC/微转移患者,集成解决不了标签噪声级别的困难。
7.4 失败模式解剖:ITC 是所有人的滑铁卢
总结论文的错误分析给出三个要点:
- ITC 识别率全体 <40%,最佳算法仅 11.4%。ITC(≤0.2mm、常为数十个细胞)在 H&E 全片上与淋巴细胞、浆细胞团几乎同貌,检测器的阈值摆动直接吞掉这类病灶。
- 混淆矩阵向低端聚集:最大错误质量集中在 pN0 ↔ pN0(i+) ↔ pN1mi 三角,pN1 ↔ pN2 次之,pN0 ↔ pN2 的极端错误最少(kappa 的距离加权也抑制了它)。
- 聚合策略放大个体差异:slide 级检测接近的队伍,患者级 kappa 可以差出 0.1 以上——把"每张切片的转移概率"翻译成"病人在第几档"没有公认最优解,各家在阈值、计数规则与概率融合上的自由度极大。
对使用者的含义:在这套数据上报告结果时,单报总 kappa 不够——按 pN 类别分层报告混淆矩阵是承认数据集设计意图的最起码做法;只优化总分的模型大概率在 pN0(i+) 上是摆设。
7.5 双冠军口径存照(坑 5 展开)
| 阶段 | 冠军 | kappa | 出处 |
|---|---|---|---|
| 会前正式阶段(TMI 收录) | Lunit | 0.8993 | IEEE-TMI Table I |
| 会后补交阶段(TMI 未收录) | Deep Bio(首尔) | 0.9570(宣称) | Deep Bio 新闻稿 |
Deep Bio 的 0.9570 只见于其公司新闻稿(其产品口径),IEEE-TMI 总结论文未收录该轮成绩。这不构成对 Deep Bio 结果真实性的否定——会后阶段组织方未发布同等严格的总结分析——但引用时必须注明"会后补交阶段、公司口径、TMI 未收录"。文献里"CAMELYON17 冠军 kappa 0.95"的说法均源于此,未注明口径即为引用不规范。
7.6 IEEE-TMI 总结论文
Bandi 等发表于 IEEE Transactions on Medical Imaging 的总结论文(DOI 10.1109/TMI.2018.2867350,正式版 vol 69,2018 在线/2019-2020 正式刊出;标题与卷期页码的最终比对存照见 §10 坑 2)是挑战赛的官方成绩档案:Table I 排行、错误分析、ITC 识别率与组合实验均出自此文。它同时给出工程规模记录——CAMELYON17 数据 2314.6 GB、CAMELYON 全项目 3030.5 GB、挑战赛平台全程托管——是引用"数据规模"时的第一出处。
7.7 会后阶段与排行榜生态
会后开放阶段(2017-05-15 至 2017-12-31)继续接受提交,排行榜持续更新,其中最著名的事件是 Deep Bio 以宣称 kappa 0.9570 登顶(§7.5 口径存照)。组织方未为该轮发布与 IEEE-TMI 同级的总结分析,会后成绩的算法描述散见于各队自述与后续文献——这正是两套口径长期混引的根源。对基准设计者的启示:正式结论窗口关闭后继续开放提交,会让排行榜进入"不可比成绩共存"状态,要么冻结榜单、要么在榜单上显式标注阶段,二选一。
7.8 共同的胜利模式
失败之外,排位靠前的算法共享三个选择:其一,strong slide 级检测器打底——几乎所有十二强都以 CNN 检测/分割网络为第一级,检测质量与最终 kappa 高度相关;其二,多尺度输入——大视野定区域、高倍率定边界,ITC 与微转移在高倍率上的可分性明显更好;其三,颜色扰动增强——跨扫描仪训练的正则化在五中心混合训练中几乎人人使用。这三条在今天仍是病理检测任务的标准配置,CAMELYON17 是它们最早的系统性验证场之一。
§8 方法学启示:四条可迁移的经验
8.1 患者级聚合是 MIL 的第一考场
CAMELYON17 用一场比赛证明:slide 级检测近乎解决之后,"把几十张切片的证据聚合成一个分期决定"才是弱监督的真难点。此后病理 MIL 文献(注意力 MIL、双流聚合、图网络聚合)几乎都以 CAMELYON17 或其精神后继(PANDA)为基准场——比赛的贡献不是冠军模型,而是把"聚合自由度"这个抽象概念变成了可量化的排行榜差距。
8.2 类别定义可以比算法更早失败
ITC 的教训不在模型而在定义层:一个临床上依赖免疫组化才能可靠确认的类别(ITC),被要求用 H&E 全片直接检测——所有算法集体失败是设计使然而非努力不足。做医学 AI 任务设计者的启示:类别边界必须落在成像模态的分辨能力之内,否则评价指标测出的是切面运气而非算法差异。
8.3 扫描仪异构是免费的域泛化基准
三款扫描仪的设计让 CAMELYON17 天然承载跨域问题。排位靠前的队伍普遍使用颜色增强/归一化,这与后来"染色归一化是病理 AI 标配"的共识互为印证。使用者可把数据按中心分层报告:单中心成绩与跨中心成绩的差值,就是你的模型对扫描域的敏感度。
8.4 挑战赛制度的遗产
CAMELYON17 与 PANDA 构成 ISBI 病理 grand challenge 的两代范本:任务从"检测"到"分级"、指标从 AUC/FROC 到 weighted kappa、评测从一次性到常驻服务器。grand-challenge.org 平台的 archive+evaluation 基础设施(本条目数据至今仍以 CC0 常驻)正是这两届比赛迭代打磨出来的制度产品。设计新挑战赛或新基准的团队,直接读这两届的协议文本是最短路径。
8.5 负结果的价值:公布排行榜不如公布错误
IEEE-TMI 总结论文最有长期引用价值的部分不是 Table I,而是错误分析:ITC 识别率、混淆矩阵的分布、组合实验的边际收益。它示范了挑战赛总结的"第二种写法"——不把排行榜当终点,而把系统性失败模式当产出。此后 PANDA 等后继挑战赛的总结论文沿用了这一结构。对基准建设者:一个数据集的可引用价值,一半在数据本身,一半在组织方公开的失败解剖。
§9 与库内条目的关系
9.1 家族图谱
| 库内条目 | rid | 与本条目关系 |
|---|---|---|
| camelyon16 | 694 | 主互链(必做):同一组织方的前作,slide 级二分类;两条目互链但分工明确——C16 细节(270+130 WSI、AUC/FROC 协议)全部留在 694 条目,本条目不复制 |
| camelyon16-17 | 33 | 旧版合并条目存照:早期把两代挑战赛合并成一条;现已被拆分为 camelyon16(694)与 camelyon17 两条新格式条目,33 保留作历史版本 |
| pcam | 158 | CAMELYON16 衍生的 patch 级基准(13 万 patch),CAMELYON 家族的"即插即用"端 |
| panda | 560 | ISBI 病理 grand challenge 第三代(前列腺分级),沿用 quadratic weighted kappa 协议 |
| panda-plus | 640 | PANDA 的像素级重标注升级版,注释方法论延续 CAMELYON 家族的多层复核流程 |
| bcss | 258 | 乳腺癌 WSI 分割数据集(同器官不同任务) |
| breakhis | 126 | 乳腺癌活检显微图像(40-400× 显微视野而非 WSI) |
| bach | 118 | 乳腺癌 H&E 四分类 WSI 基准 |
| breastpathq | 268 | 乳腺癌病理评分 WSIs(Kaggle 谱系挑战赛) |
| midog | 298 | 有丝分裂检测(乳腺癌 WSI 域内更细粒度任务) |
| digestpath | 338 | 消化道病理多任务(跨器官 challenge 谱系对照) |
| nucls / lizard / consep | 248 / 238 / 228 | 细胞核分割与检测家族(patch 级、像素级监督对照) |
9.2 关系边界声明
本条目与 camelyon16(rid 694)的分工:C16 条目负责 slide 级二分类任务、FROC 协议与 C16 数据细节;本条目负责患者级五类分期、kappa 协议与 C17 数据细节。两代任务不可互换评测(坑 8),两条目互链处仅描述"任务演进关系"而不搬运对方内容。camelyon16-17(rid 33)作为旧版合并条目已冻结,其内容以两条新条目为准;从 33 跳转而来的读者请以 694 与本条目为现行版本。
9.3 检索路径建议
- 要"乳腺癌淋巴结转移检测"入门:先读 camelyon16(694)再回本条目,任务演进更顺。
- 要"患者级分期/MIL 基准":本条目为主,panda(560)为精神后继对照。
- 要"patch 级轻量基准":pcam(158)。
- 要"乳腺癌病理全景":breakhis(126)/ bach(118)/ bcss(258)/ breastpathq(268)/ midog(298)横向对比。
§10 避坑清单:十个已踩过的坑
坑 1:pN 是五类不是四类。任务简报与部分二手资料把 pN 写成"四类分期",实际官网 Evaluation 页与 IEEE-TMI 论文均为五类:pN0 / pN0(i+) / pN1mi / pN1 / pN2。pN0(i+)(仅 ITC)单列是本挑战赛相对临床常规报告的增强设计,漏掉它会让 kappa 计算类别数直接错误。
坑 2:ISBI 年份与论文年份错位。挑战赛挂靠 ISBI 2017(墨尔本,2017-04-18/21);IEEE-TMI 总结论文 2018 在线、正式卷期 vol 69(2019-2020 口径),Bandi 论文的标题与卷期页码在不同数据库记录中存在表述差异,正式引用前以 IEEE Xplore 页面为准(本条目以 DOI 10.1109/TMI.2018.2867350 为锚)。
坑 3:1000 vs 1399 张双口径。挑战赛发放 1000 张(500 train + 500 test,患者级聚合口径),GigaScience 归档 1399 张(含患者全部切片)。两数并存皆正确,引用必须声明口径;GB 口径同理(归档 2.95 TB vs IEEE-TMI 记录 2314.6 GB)。
坑 4:许可演变,旧教程引旧 license。挑战期 CC BY-NC-ND 4.0 → 现行 CC0 1.0(官网+GigaDB+AWS 三源一致)。2018 年前的第三方转载、部分中文博客仍写 CC BY-NC-ND;以现行 CC0 为准,但若你看到的页面写着"仅限学术、禁止商用",那是过期信息。
坑 5:Deep Bio 0.9570 是会后补交口径。正式阶段冠军 Lunit 0.8993(IEEE-TMI Table I 收录);Deep Bio 宣称的 0.9570 出自会后补交阶段与其公司新闻稿,未被 TMI 论文收录。文献中"冠军 kappa 0.95"未注明口径的引用一律视为不规范——两套成绩不可排进同一张榜。
坑 6:pN2 定义口径。AJCC 通用语境 pN2 为"4-9 个阳性淋巴结"(另有内乳淋巴结分支定义);CAMELYON 官网 Evaluation 页按挑战赛简化口径描述。跨文献比较 pN 分布时先对齐定义(本条目 §2.5 表采用官网口径并注明)。
坑 7:官网子页路径首字母大写。camelyon17.grand-challenge.org 的子页为 /Data/、/Evaluation/——小写路径 404。抓取官网内容或写爬虫时按大写路径构造。
坑 8:C16 与 C17 任务不可互换。C16 是 slide 级二分类(AUC/FROC 评测),C17 是患者级五类分期(weighted kappa 评测)。在 C16 上训练的模型不能直接产出 C17 排行可比结果——聚合层缺失。同理,两代数据不重叠,别把 C16 的 400 张计入 C17 的规模。
坑 9:伦理批号双写法。GigaScience 论文登记 NL48845.091.16,部分文件写作 2016-2761——同一审查的两个记录口径并存。引用伦理批号时注明出处文件;本条目正文以论文登记号为主。
坑 10:归档与发放的文件组织不同。官网发放按 train/test 组织(挑战赛流程口径),GigaDB 归档按数据集结构组织(数据论文口径)——两套目录树不互为镜像,把"官网路径假设"直接搬到 GigaDB 批量脚本会碎;迁移脚本一律以各渠道 README 的实际清单为准,勿假设文件名规范一致。
§11 总结
11.1 三句话总结
- CAMELYON17 把病理 AI 的考题从"这张切片有没有转移"升级为"这个病人是第几档",用患者级 pN 五类分期模拟真实临床决策,是弱监督聚合(MIL)路线的第一代公开基准。
- 23 队 37 算法的成绩光谱(kappa 0.89 ~ -0.13)与 ITC 集体失败(<40%,最佳 11.4%)共同揭示:类别定义超出成像模态分辨能力时,算法再强也无解。
- 数据以 CC0 1.0 归档(GigaDB doi:10.5524/100505 + AWS Open Data 等五渠道),许可门槛归零,是少数"挑战赛结束后数据反而更开放"的范本。
11.2 适合谁
- 多示例学习(MIL)研究者:需要一个"slide 级证据 → 患者级决定"的标准考场。
- 弱监督检测团队:1000 张发放 WSI + slide 级 XML 注释可直接训练检测/分割。
- 挑战赛设计者:kappa 协议、平局破解、常驻评测服务器——制度设计的活教材。
- 乳腺癌辅助诊断系统团队:pN 分期的临床语义完整,可直接映射 TNM 工作流。
11.3 不适合谁
- 需要像素级密集监督做分割研究的主力训练集(lesion 级注释仅 209 张 WSI,C16+C17 全项目合计)。
- 需要公开测试标签做离线迭代的项目(测试 pN 标签不公开,须走官方服务器)。
- 需要 tile 化即插即用包的快速原型(无 PCam 式衍生包随数据提供,需自行切片)。
- 期望单一中心同质数据的研究(三款扫描仪、五家医院的异构性是特性也是负担)。
11.4 30 秒决策卡
| 你的情况 | 行动 |
|---|---|
| 要立刻下数据跑通 | AWS S3 s3://camelyon-dataset(CC0,无需注册)+ OpenSlide 读 TIFF |
| 要做 slide 级检测 | 用 XML 注释转 mask 训练;先在 500 训练 WSI 内切验证集 |
| 要做患者级分期 | 自己写聚合逻辑;对照 §3.2 四条陷阱设计阈值与计数规则 |
| 要对比排行榜 | 只用 IEEE-TMI Table I 口径(Lunit 0.8993);Deep Bio 0.9570 注明会后口径(坑 5) |
| 要 patch 级轻量原型 | 转用 pcam(rid 158);本条目数据做终验 |
| 要引用数据集 | GigaScience 论文(giy065)+ 需要排行榜时加引 IEEE-TMI(DOI 10.1109/TMI.2018.2867350) |
FAQ(高频问答 40 问)
A. 基础认知
Q1:CAMELYON17 的"CAMELYON"是什么缩写?
CAMELYON = Cancer METastases Lymph Node,直译"癌症淋巴结转移"。家族现有 CAMELYON16(slide 级二分类)与 CAMELYON17(患者级五类分期)两代。
Q2:它和 ISBI 是什么关系?
它是 ISBI 2017(IEEE International Symposium on Biomedical Imaging,墨尔本,2017-04-18/21)的官方 grand challenge 之一,现场公布成绩;数据与评测平台则常驻 grand-challenge.org。
Q3:挑战赛之后数据还在维护吗?
数据本体已归档(GigaDB + AWS Open Data),不再"维护"但长期保存;官网与评测服务器由 grand-challenge.org 平台持续托管。CC0 许可意味着即使原官网失效,GigaDB/AWS 的存档也足以独立支撑使用。
Q4:数据是哪来的?
5 家荷兰医院 2016 年前后采集的乳腺癌前哨/腋窝淋巴结切除标本,常规病理流程的 H&E 切片扫描数字化;伦理批号 NL48845.091.16(坑 9 双写法存照)。
B. 数据与获取
Q5:数据到底多少张?
按口径:挑战赛发放 1000 张(500 训练 + 500 测试);GigaScience 完整归档 1399 张(2.95 TB)。引用时声明口径(坑 3)。
Q6:怎么下载最快?
脚本批量走 AWS S3(aws s3 sync s3://camelyon-dataset ./ --no-sign-request 口径,us-east-1,无需账号);国内网络走 Baidu Pan;要校验和走 GigaDB(doi:10.5524/100505)。
Q7:商用可以用吗?
可以。现行许可 CC0 1.0(三源一致),无商业限制;挑战期的 CC BY-NC-ND 已被取代(坑 4)。学术礼仪上仍建议引用两篇论文。
Q8:测试集标签能拿到吗?
不能。100 名测试患者的 pN 真实标签由官方评测服务器持有,从未公开。外部研究要么走服务器评测,要么自行注释(自行注释不能与官方排行榜直接比较)。
Q9:XML 注释里有什么?
slide 级转移分割多边形,分 macro(宏转移)与 micro(微转移)两层;另有 50 张 WSI 的 lesion 级细注释(每中心 10 张)。没有 ITC 独立层——ITC 级信息只体现在 slide 标签与患者 pN 标签中。
Q10:图像格式怎么读?
标准 TIFF(大文件 bigTIFF),512px tile,JPEG 压缩。Python 生态用 OpenSlide 或 tifffile 直接读;分辨率 0.23-0.25 μm/px,逐张读元数据而非假设统一倍率。
C. 任务与评估
Q11:五类 pN 依次是什么意思?
pN0 无转移;pN0(i+) 仅孤立肿瘤细胞(≤0.2mm);pN1mi 有微转移(0.2-2mm);pN1 计入 1-3 个阳性淋巴结;pN2 达 4 个及以上阳性淋巴结(官网口径,坑 6)。
Q12:为什么用 quadratic weighted kappa 而不是 accuracy?
五类有序 + 类别不平衡,accuracy 被多数类主导;weighted kappa 校正随机一致并对远距离错误重罚(pN0↔pN2 错误代价是 pN0↔pN0(i+) 的 16 倍),与临床后果的方向一致。
Q13:平局怎么破?
kappa 相同按 pN2→pN0 逆序逐类比较单类 kappa——更严重分期识别更好者胜。
Q14:冠军成绩到底是多少?
正式阶段 Lunit 0.8993(TMI 收录);会后补交阶段 Deep Bio 宣称 0.9570(公司口径,TMI 未收录)。两套口径不混引(坑 5)。
Q15:ITC 为什么这么难?
ITC 是几十个肿瘤细胞的微小病灶,H&E 上与淋巴细胞团几乎同貌,临床确认常依赖免疫组化——超出纯 H&E 成像的可靠分辨能力,37 个算法识别率全部 <40%(最佳 11.4%)。
Q16:组合模型为什么只多对 1 个患者?
单算法最佳 76/100,多算法融合 0.9261 / 77/100。错误高度重叠在同一批 ITC/微转移患者上——这是标签噪声级别的困难,集成学习无法跨过。
D. 生态与库内
Q17:和 CAMELYON16 用同一批患者吗?
不是。C16 是 110 名患者 400 张 WSI,C17 是 200 名患者(发放口径 1000 张);数据不重叠,任务不可互换(坑 8)。
Q18:PANDA 是它的后继吗?
精神后继。ISBI 病理 grand challenge 谱系:C16(2016 检测)→ C17(2017 分期)→ PANDA(2020 前列腺分级,沿用 weighted kappa)。本库 rid 560(panda)/640(panda-plus)有延续叙述。
Q19:PCam 是从 C17 切的吗?
不是,PCam 从 CAMELYON16 采样(本库 rid 158)。但 PCam 生态常与 C17 并列引用,构成"全片-补丁"两用光谱。
Q20:现在还有人在 C17 上发论文吗?
有。作为 MIL/弱监督的标准测试床,C17 持续出现在聚合策略、域自适应与标签噪声研究里;两篇论文合计引用 >2000 次(2026 口径存照)。
Q21:库内怎么找相关条目?
camelyon16(694,前作)、pcam(158,patch 基准)、panda(560,谱系后继)、bcss(258)/bach(118)/breakhis(126)/breastpathq(268)/midog(298,乳腺癌家族)、nucls(248)/lizard(238)/consep(228,细胞核分割)、digestpath(338)。
Q22:旧版 camelyon16-17 条目还能用吗?
rid 33 是旧版合并条目,已冻结;现行以 camelyon16(694)+ camelyon17 两条为准。
E. 工程与实践
Q23:训练数据里 ITC 标签可靠吗?
相对最弱。ITC 级病灶的 slide 标签依赖 H&E 上对几十个细胞的确认,而临床实践中 ITC 常由 cytokeratin 免疫组化检出——GigaScience 论文与 IEEE-TMI 总结论文均明示 ITC 层是最大噪声源。做 ITC 相关研究时应把标签当"弱金标准"对待并做抽样人工复核。
Q24:一个患者多张 WSI,训练/验证怎么划分?
按患者划分,绝不按切片划分。同一患者的切片高度相关,按切片切验证集会把患者信息泄漏进训练集,验证分数虚高。官方口径本身就是 100 名患者一档。
Q25:数据里有免疫组化(IHC)切片吗?
没有。CAMELYON17 只提供 H&E 切片;挑战赛的任务设定正是"仅凭 H&E 做 pN 分期"。这也是 ITC 难度的根源(临床确认 ITC 常靠 IHC)。
Q26:有没有官方 baseline 代码?
挑战赛当年未发布官方 baseline 仓库;官网提供数据与评测协议,算法实现由参赛队伍自理。社区复现实现(含 slide 级检测 + 患者级聚合管线)散见于各参赛队论文与后续 MIL 文献,用前核对其聚合规则与本条目 §3.2 的口径。
Q27:注释是像素级 mask 吗?
slide 级 XML 注释给出转移区域的多边形轮廓,可转成像素级二值/多类 mask(macro/micro 两层);但官方不直接发布渲染好的 mask 文件,转换是使用者的标准前置工程(附录 H.2 给出骨架)。
Q28:能直接拿去训练商业产品吗?
许可上可以(CC0 1.0 无商业限制);医学合规上,用挑战赛数据训练的临床产品仍需按目标市场的医疗器械法规走验证与审批——数据许可与产品合规是两条独立的线。
Q29:图像分辨率不统一怎么处理?
0.23-0.25 μm/px 的区间差异来自三款扫描仪。统一做法:读每张 WSI 头内的分辨率元数据,按物理分辨率(如 0.5 μm/px)重采样到统一倍率再做下游,而不是按像素倍率硬缩放。
Q30:验证集该多大、怎么分中心?
建议两层:从 500 训练 WSI 内按患者分层抽 15-20% 做内部验证(保持五类 pN 比例),并额外做"留一中心"式跨中心评估以量化域泛化(附录 U)。
F. 引用与存照
Q33:CAMELYON17 的 patch 化衍生数据有哪些?
官方未发布 patch 化版本。社区常见做法是从 C17 WSI 自行切 tile 训练;另有研究把 C17 与 PCam(C16 衍生)混合评测,但两者患者不重叠、任务不同,混合时必须按数据集分层报告。
Q34:如何确认我下载的数据完整?
以 GigaDB record 100505 的文件清单与校验和为准;S3 渠道用 aws s3 ls --summarize 对比文件数与字节数。TIFF 完整性可批量跑 OpenSlide 打开检查(损坏文件通常在读 tile 时抛错)。
Q35:可以把 C17 测试集当训练数据吗?
许可上可以(CC0),但会把官方评测通道作废——在测试集上训练的模型不再能引用官方排行榜口径,且文献社区对此有明确伦理共识:发布结果时必须声明测试集的使用方式。
Q36:slide 级标签与 pN 标签冲突怎么办?
理论上不应冲突(pN 由 slide 标签聚合而来),但切面采样运气会导致个别 slide 无转移而患者有 pN 标签。做 slide 级任务用 slide 标签,做患者级任务用 pN 标签,两套监督信号不混贴在同一损失里。
Q37:挑战赛排行榜上负 kappa 怎么解读?
负值意味着预测与真实呈反向一致——在有序任务上通常是输出类别索引错位(encoder 顺序错)或系统性判反。复现时遇到负 kappa 先查类别映射,再怀疑模型(H.3 同款陷阱)。
Q38:这份数据适合做自监督预训练吗?
适合且常被这么用:1399 张全片(归档口径)的 H&E 组织量可观,多个病理基础模型的文献列表中 CAMELYON17 出现在评测或中间训练环节。但注意它与 C16 的图像有同源风格,做预训练评测时避免与下游任务家族重叠导致泄漏式乐观。
Q39:引用"ITC 识别率 <40%"时的准确表述?
表述为"会前正式阶段 37 个算法对 ITC 的识别率均不足 40%,最佳为 11.4%“(IEEE-TMI 错误分析口径),不要写成"数据集 ITC 标注错误率 60%”——那是算法能力,不是标签质量。
Q40:在哪里跟进数据集的后续动态?
官网(camelyon17.grand-challenge.org)公告与 GigaDB record 页;CAMELYON 家族无独立邮件列表。重大改版(如新阶段开放)通常也会在 grand-challenge.org 平台层公告。
Q31:引用格式?
数据:Litjens G, et al. 1399 H&E-stained whole slide images… CAMELYON17 data collection. GigaScience 2018;7(6):giy065. doi:10.1093/gigascience/giy065。挑战结果:Bandi P, et al. IEEE Trans Med Imaging. doi:10.1109/TMI.2018.2867350。
Q32:本文数字的抓取时点?
2026-09-27。官网页面内容(许可、渠道、评测协议)与 Google Scholar 引用量均为该时点存照;排行榜数字以 IEEE-TMI 论文为准,不随时间变化。
事实清单(硬事实 30 条)
- CAMELYON17 官方全称:Assessment of Lymph Node Metastases in Breast Cancer Patients。
- 挂靠 ISBI 2017(墨尔本,2017-04-18/21)。
- 组织方:Radboud University Medical Center + University Medical Center Utrecht。
- 官网:camelyon17.grand-challenge.org(子页路径首字母大写)。
- 网站 2016-11-10 上线;会后提交截止 2017-12-31。
- 任务:患者级 pN 五类分期(pN0/pN0(i+)/pN1mi/pN1/pN2)。
- 参考管线两步:slide 级转移检测 → 患者级聚合分期。
- 数据:5 家荷兰医院 × 各约 100 名训练/测试患者,共 200 名患者。
- 挑战赛发放 1000 张 WSI;GigaScience 归档 1399 张(2.95 TB)。
- 五中心可用例数:RUMC 130 / CWZ 144 / UMCU 129 / RST 168 / LPON 140。
- 扫描仪 3 款:3DHistech Pannoramic Flash II 250、Hamamatsu NanoZoomer-XR C12000-01、Philips Ultrafast。
- 格式:TIFF(>4GB bigTIFF)、512px tile、0.23-0.25 μm/px、JPEG 压缩、RGB 8-bit。
- 训练 slide 标签分布:None 323 / Macro 85 / Micro 57 / ITC 35(500 张)。
- 训练患者 pN 分布:pN0 25 / pN0(i+) 11 / pN1mi 21 / pN1 30 / pN2 13(100 名)。
- 注释:XML slide 级 macro/micro 双层多边形;lesion 级 50 张(每中心 10 张);全项目 lesion 轮廓 209 WSI。
- 标注质量链:资深标注者 → 2 名病理学家复核(RUMC/LPON)→ 病理主任终审。
- 伦理批号 NL48845.091.16(另一口径 2016-2761,坑 9)。
- 许可演变:挑战期 CC BY-NC-ND 4.0 → 现行 CC0 1.0(三源一致)。
- 五条获取渠道:GigaDB(doi:10.5524/100505)/ Google Drive / Baidu Pan / AWS S3 s3://camelyon-dataset / 官网注册。
- 评测指标:五类 quadratic weighted Cohen’s kappa;平局按 pN2→pN0 逆序单类 kappa 破解。
- 参赛规模:23 队 / 37 算法。
- 正式阶段冠军 Lunit kappa 0.8993;第二 HMS-MGH-CCDS 0.8806;第三 VCA-TUe 0.8729。
- 十二强门槛 0.7330(MI-KA);kappa 极差 0.89 ~ -0.13。
- 单算法最佳正确分期 76/100;多算法组合 0.9261、77/100。
- ITC 识别率全部 <40%,最佳 11.4%。
- 会后补交阶段 Deep Bio 宣称 kappa 0.9570(公司口径,TMI 未收录)。
- 数据论文:Litjens et al., GigaScience 7(6), 2018, doi:10.1093/gigascience/giy065。
- 总结论文:Bandi et al., IEEE TMI, doi:10.1109/TMI.2018.2867350。
- IEEE-TMI 记录数据体量:C17 2314.6 GB;CAMELYON 全项目 3030.5 GB。
- 两篇论文合计引用 >2000 次(2026-09-27 存照口径)。
术语表(26 条)
| 术语 | 释义 |
|---|---|
| WSI | Whole Slide Image,全切片扫描数字图像 |
| pN | 病理淋巴结分期(TNM 之 N 的病理版) |
| pN0 | 区域淋巴结无转移 |
| pN0(i+) | 仅有孤立肿瘤细胞(免疫组化或 HE 可见,≤0.2mm) |
| pN1mi | 存在微转移(>0.2mm 且 ≤2mm) |
| ITC | Isolated Tumor Cells,孤立肿瘤细胞(≤0.2mm 或单切面 ≤200 细胞) |
| 宏转移 | Macro-metastasis,转移灶 >2mm |
| 前哨淋巴结 | Sentinel lymph node,肿瘤引流第一站淋巴结 |
| SLNB | 前哨淋巴结活检 |
| quadratic weighted kappa | 二次加权 Cohen’s kappa,有序分类一致性指标 |
| Cohen’s kappa | 校正随机一致后的观察一致性系数 |
| MIL | Multiple Instance Learning,多示例学习 |
| FROC | Free-Response ROC,检测类任务的自由响应 ROC |
| bigTIFF | 超过 4GB 的 TIFF 扩展容器格式 |
| tile | WSI 的金字塔分块存储单元(此处 512×512) |
| μm/px | 每像素微米数,空间分辨率 |
| CC0 | 公有领域贡献许可(Creative Commons Zero) |
| grand challenge | 学术会议主办的公开算法竞赛 |
| domain shift | 域偏移,扫描设备/染色差异导致的分布变化 |
| AI-Ready | 数据可用于 AI 训练就绪度(发现/访问/互操作/元数据/可持续) |
| macro-metastasis | 宏转移(>2mm),C17 XML 的 Macro 层 |
| grand-challenge.org | 挑战赛托管平台,CAMELYON 家族的常驻评测基础设施 |
| AWS Open Data | 亚马逊开放数据计划,CAMELYON17 的对象存储渠道 |
| patient-level aggregation | 患者级聚合,从切片证据到分期决定的映射 |
附录
附录 A:条目信息速查卡
| 项 | 值 |
|---|---|
| slug | camelyon17 |
| 条目 URL | https://www.qianfanghub.com/ai-ready-dataset/camelyon17/699 |
| 实体类型 | 挑战赛 + 数据集(双实体) |
| 官网 | https://camelyon17.grand-challenge.org/ |
| 数据 DOI | 10.5524/100505(GigaDB) |
| 数据论文 DOI | 10.1093/gigascience/giy065 |
| 总结论文 DOI | 10.1109/TMI.2018.2867350 |
| 现行许可 | CC0 1.0 |
| 任务 | 患者级 pN 五类分期 |
| 主指标 | quadratic weighted kappa |
| 规模 | 200 患者;1000(发放)/ 1399(归档)张 WSI |
| 锁文件 | writing/camelyon17/.lock |
| FACTS.md | writing/camelyon17/FACTS.md(九节) |
| 库内主互链 | camelyon16(rid 694) |
附录 B:DAIMS 评估全表
| 维度 | 等级 | 证据 |
|---|---|---|
| D 可发现性 | A | DOI×3、官网、AWS Open Data、两篇论文互指 |
| A 可访问性 | A- | CC0 五渠道;扣分项:测试标签不公开 |
| I 互操作性 | B+ | 标准 TIFF 可 OpenSlide 直读;XML 需自行转 mask |
| M 元数据 | B+ | slide 标签表 + pN 表 + WSI 头内分辨率;无统一数据字典 |
| S 可持续性 | A | GigaDB 学术归档 + AWS Open Data 双保险 |
附录 C:逐项证据链自证
| 条目内声明 | 出处 |
|---|---|
| 五类 pN 任务定义 | 官网 Evaluation 页 + IEEE-TMI 论文 |
| 200 患者 / 1000 发放 | 官网 Data 页 |
| 1399 张 / 2.95 TB / 格式参数 / 各分布表 | GigaScience 论文 Table 1-6 |
| 23 队 37 算法 / Table I / ITC <40% / 组合 0.9261 | IEEE-TMI 总结论文 |
| CC0 1.0 | 官网 Data 页 + GigaDB record + AWS Open Data 页 |
| Deep Bio 0.9570 | Deep Bio 新闻稿(口径存照,非同行评审) |
| 伦理批号 | GigaScience 论文伦理节 |
附录 D:数据获取决策树
需要 CAMELYON17 数据?
├─ 批量脚本下载(训练流水线)
│ └─ AWS S3: s3://camelyon-dataset(--no-sign-request,us-east-1)
├─ 需要校验和与学术归档
│ └─ GigaDB doi:10.5524/100505
├─ 中国大陆网络
│ └─ Baidu Pan(官网 Data 页链接)
├─ 单文件补拉
│ └─ Google Drive(官网 Data 页链接)
└─ 还要跑官方评测
└─ 官网注册(注意 /Data/ /Evaluation/ 大写路径)
附录 E:本条目生产档案
- 生产代理:agentA-camelyon17;锁文件:writing/camelyon17/.lock(2026-09-27T10:19:55Z)
- slug 查重:camelyon16(694)、camelyon16-17(33)在库,camelyon17 未被占用,正常生产
- 事实研究:官网(大写路径)+ EuropePMC REST 抓取 GigaScience 全文 JATS XML + IEEE-TMI 论文 PDF(pdftoppm 转图后视觉读取表格)多轮互证
- FACTS.md:writing/camelyon17/FACTS.md 九节
- 成稿方式:五块直写拼接(part1-5),全程不用 Edit 追加
- 坑点:§10 十则(坑 1-10"坑 N:"编号制)
- brief 两处纠错已核验:pN 五类(非四类);ISBI 2017(非 2018)
- 互链计划:正文内链 camelyon16(694)/pcam(158)/panda(560) 等;与 694 分工不复制内容
附录 F:FAIR/AI-Ready 检查单
| 检查项 | 状态 | 说明 |
|---|---|---|
| F1 全局唯一标识 | ✅ | DOI(GigaDB/论文×2) |
| F2 富元数据 | ✅ | GigaScience 表 1-6 + WSI 头内元数据 |
| A1 可访问协议 | ✅ | CC0,HTTP/S3 直链 |
| A2 元数据可访问 | ✅ | 论文与 GigaDB 记录开放 |
| I1 互操作格式 | ✅ | TIFF/XML 标准格式 |
| I2 词汇表引用 | ✅ | AJCC pN 标准术语 |
| R1 来源溯源 | ✅ | 五中心/扫描仪/伦理批号齐备 |
| R3 可复现流程 | ⚠️ | 测试评测需官方服务器(标签不公开) |
| AI-Ready 综合 | 中高 | 训练侧全开放;测试侧依赖服务评测 |
附录 G:缩写速查
| 缩写 | 全称 |
|---|---|
| C16 / C17 | CAMELYON16 / CAMELYON17 |
| RUMC | Radboud University Medical Center |
| UMCU | University Medical Center Utrecht |
| CWZ | Catharina Ziekenhuis |
| RST | Rijnstate |
| LPON | Laboratorium Pathologie Oosten-Nederland |
| ISBI | IEEE International Symposium on Biomedical Imaging |
| TMI | IEEE Transactions on Medical Imaging |
| ITC | Isolated Tumor Cells |
| QWK | Quadratic Weighted Kappa |
| MIL | Multiple Instance Learning |
| DAIMS | Discoverability/Accessibility/Interoperability/Metadata/Sustainability |
附录 H:工程复现骨架
H.1 WSI 读取(OpenSlide)
import openslide
slide = openslide.OpenSlide("patient_000_node_0.tif")
print(slide.dimensions) # 全分辨率 (w, h)
print(slide.level_count) # 金字塔层数
print(slide.properties[openslide.PROPERTY_NAME_MPP_X]) # μm/px,逐张读取!
# 以目标物理分辨率 0.5 μm/px 读取一个 1024x1024 区域
mpp_x = float(slide.properties[openslide.PROPERTY_NAME_MPP_X])
scale = mpp_x / 0.5
region = slide.read_region(
location=(10000, 10000), level=0,
size=(int(1024 * scale), int(1024 * scale))
).convert("RGB").resize((1024, 1024))
要点:分辨率必须逐张从元数据读取(0.23-0.25 μm/px 区间差异,坑见 Q29);bigTIFF 由 OpenSlide 透明处理;图像是 RGBA,要显式转 RGB。
H.2 XML 注释转像素 mask
import xml.etree.ElementTree as ET
import numpy as np
GROUP_LABEL = {"Macro": 2, "Micro": 1} # 背景 0;类别权重可按任务调整
def xml_to_mask(xml_path, slide, level=0, downsample=16):
tree = ET.parse(xml_path)
root = tree.getroot()
w, h = slide.level_dimensions[level]
mask = np.zeros((h, w), dtype=np.uint8)
for group in root.iter("Group"):
name = group.attrib.get("Name", "")
label = GROUP_LABEL.get(name)
if label is None:
continue
for region in group.iter("Region"):
vertices = [
(float(v.attrib["X"]), float(v.attrib["Y"]))
for v in region.iter("Vertex")
]
# 将多边形顶点映射到目标层级后栅格化
ds = slide.level_downsamples[level] * downsample
poly = [(x / ds, y / ds) for x, y in vertices]
# 用 PIL/cv2 的 fillPoly 填充 poly(略)
return mask
要点:CAMELYON 的 XML 结构为 Annotations → Group(Name=Macro/Micro)→ Region → Vertex;栅格化时注意坐标层级与下采样倍率的一致性——这是社区复现中最常见的错误源。
H.3 患者级评估骨架
import numpy as np
def quadratic_weighted_kappa(y_true, y_pred, K=5):
# 类别索引需按 pN 序数排列: 0=pN0, 1=pN0(i+), 2=pN1mi, 3=pN1, 4=pN2
O = np.zeros((K, K))
for t, p in zip(y_true, y_pred):
O[t, p] += 1
O /= O.sum()
w = np.array([[(i - j) ** 2 / (K - 1) ** 2 for j in range(K)]
for i in range(K)])
e_true, e_pred = O.sum(axis=1), O.sum(axis=0)
E = np.outer(e_true, e_pred)
return 1 - (w * O).sum() / (w * E).sum()
def tie_break_report(y_true, y_pred_list):
# 平局破解复现: 按 pN2->pN0 逆序逐类二值化比较单类 kappa
for cls in range(4, -1, -1):
bin_true = (y_true == cls).astype(int)
scores = [quadratic_weighted_kappa(bin_true, (p == cls).astype(int))
for p in y_pred_list]
print(f"class {cls}: {scores}")
要点:sklearn 的 cohen_kappa_score(..., weights="quadratic") 可直接替代手写;但自写一遍的价值在于确认类别索引顺序——任何把 pN0(i+) 排到末位的 label encoder 都会让权重矩阵错位(这是复现 C17 分数最隐蔽的 bug)。
附录 I:quadratic weighted kappa 计算要点
对五类有序分类,QWK = 1 − Σ w_ij·O_ij / Σ w_ij·E_ij,其中权重 w_ij = (i−j)²/(K−1)²(K=5),O 为混淆矩阵实测分布,E 为两边缘向量外积构成的期望分布。五个要点:
- 权重矩阵按类别的序数索引计算,不是按类别代码任意排列——pN0(i+) 的索引在 pN0 与 pN1mi 之间,重排类别顺序会改变分数。
- (i−j)² 使 pN0↔pN2 的错误代价是 pN0↔pN0(i+) 的 16 倍(4²/1²)。
- kappa 已经校正随机一致:永远输出多数类的算法 kappa 趋近 0 而非正数。
- 与 accuracy 不同,QWK 对类别不平衡稳健,但小样本(每类 11-30 名患者)下单患者错位可造成 0.02-0.05 的波动——排行榜相邻名次的差距未必有统计意义。
- 复现排行榜时注意测试集只有 100 名患者,任何自建验证集上的 kappa 都不能与官方分数直接比较。
附录 J:患者级聚合规则参考伪代码
def aggregate_to_pn(slide_findings):
# slide_findings: 每张 WSI 的检测输出列表
# [{level: "macro"|"micro"|"itc", prob: float}, ...]
nodes = group_by_node(slide_findings) # 按淋巴结聚合
positive = [n for n in nodes if n.has_tumor]
has_macro = any(n.has_macro for n in positive)
has_micro = any(n.has_micro for n in positive)
only_itc = positive and all(n.only_itc for n in positive)
n_positive = len(positive)
if n_positive == 0:
return "pN0"
if only_itc:
return "pN0(i+)" # 全部病灶均为 ITC 级
if has_micro and not has_macro and n_positive <= 3:
return "pN1mi"
if n_positive <= 3:
return "pN1"
return "pN2" # 官网口径:>=4 阳性淋巴结
这条规则链是 §3.2 四条陷阱的落地形态。注意两个自由度:其一,micro 患者在 AJCC 里也计入 pN1(pN1mi 是标注性子档),实现时按官网口径输出 pN1mi;其二,全部基于概率输出时,"has_tumor"由阈值定义——阈值敏感性分析(附录 U)是必做项。
附录 K:训练 pN 分布与临床真实分布对照
| pN 分期 | C17 训练集占比 | 一般临床参考 | 设计意图 |
|---|---|---|---|
| pN0 | 25% | 30-70%(视筛查人群) | 压低到富集边缘 |
| pN0(i+) | 11% | <5%(H&E 常规检出更低) | 大幅富集——保 ITC 类可学 |
| pN1mi | 21% | 5-10% | 富集 |
| pN1 | 30% | 15-25% | 接近 |
| pN2 | 13% | 10-20% | 接近 |
讨论:真实临床队列中 pN0(i+) 极少被常规 H&E 检出(多数由 IHC 发现),若按真实分布采样,ITC 类样本会少到无法训练——组织方的富集是让五类都可学的必要设计。反过来,在这套数据上训练的先验不能直接搬去临床部署:部署场景的 pN0(i+) 率比训练分布低数倍,假阳性代价随之放大。
附录 L:十二强队伍注记(IEEE-TMI 口径)
| 队伍 | kappa | 注记 |
|---|---|---|
| Lunit | 0.8993 | 首尔,InsightDL 平台团队;CAMELYON16 正式阶段榜首,两代连庄 |
| HMS-MGH-CCDS | 0.8806 | 哈佛医学院-麻省总医院计算病理与数据科学团队 |
| VCA-TUe | 0.8729 | Eindhoven 理工大学系队伍 |
| MIL-GPAT | 0.8567 | 队名即示多示例学习(MIL)路线 |
| Indica Labs | 0.8554 | 商业数字病理软件商 |
| chengshenghua | 0.8439 | 学术队伍 |
| DTU | 0.8098 | 丹麦技术大学 |
| CMT-CUHK | 0.7718 | 香港中文大学系 |
| destuo | 0.7640 | 代尔夫特理工系 |
| METU-VISION | 0.7599 | 中东技术大学(土耳其) |
| Proscia | 0.7554 | 数字病理初创公司 |
| MI-KA | 0.7330 | 十二强门槛线 |
队伍构成横跨学术(哈佛/港中文/DTU/TUe…)与商业(Lunit/Indica/Proscia/Deep Bio),是病理 AI 早期产业化的一个横断面。
附录 M:与库内 camelyon16 条目(rid 694)的关系声明
| 维度 | camelyon16(rid 694) | 本条目(camelyon17) |
|---|---|---|
| 承载内容 | C16 数据细节、slide 级二分类、FROC/AUC 协议 | C17 数据细节、患者级五类分期、QWK 协议 |
| 互链方式 | 双向内链,仅描述任务演进 | 同左 |
| 内容复制 | 禁止 | 禁止 |
| 数字口径 | C16:270 train + 130 test WSI、110 患者 | C17:1000/1399 张、200 患者 |
| 读者动线 | 从 C16 读完"检测"再来本条目读"分期" | 从本条目 §3.3 表可回看 C16 差异 |
camelyon16-17(rid 33)为旧版合并条目,已冻结;两条新条目为现行版本,33 页面应加跳转说明(由维护方处理,本条目仅存照)。
附录 N:乳腺癌病理数据集景观对照(库内)
| 条目 | rid | 模态 | 任务 | 与 C17 的互补 |
|---|---|---|---|---|
| camelyon17 | — | WSI 全片 | 患者级分期 | 本体 |
| camelyon16 | 694 | WSI 全片 | slide 级检测 | 检测端前作 |
| pcam | 158 | patch | 二分类 | 轻量原型 |
| bcss | 258 | WSI + mask | 区域分割 | 像素级监督 |
| bach | 118 | WSI/显微 | 四分类 | slide 级分类对照 |
| breakhis | 126 | 显微视野 | 良恶性分类 | 非扫描仪模态 |
| breastpathq | 268 | WSI | 评分 | 有序回归对照 |
| midog | 298 | WSI patch | 有丝分裂检测 | 细胞级细任务 |
附录 O:CC0 与 CC BY-NC-ND 条款对照
| 权利/义务 | CC0 1.0(现行) | CC BY-NC-ND 4.0(挑战期) |
|---|---|---|
| 商业使用 | 允许 | 禁止 |
| 衍生作品 | 允许 | 禁止分发演绎版 |
| 署名要求 | 无(礼仪性建议) | 必须 |
| 再分发 | 无限制 | 原样+署名 |
| 对模型权重的含义 | 权重可任意许可 | 2017 年前的衍生模型边界存疑 |
结论:今天以任何目的使用(含商用训练)都不违反数据许可;仅当引用 2016-2017 年挑战赛期间的中间产物时,需留意其时点适用的旧条款。
附录 P:XML 注释数据字典
| 元素/属性 | 含义 |
|---|---|
Annotations |
根节点 |
Annotation |
一名标注者的一次注释会话 |
Group[@Name] |
注释组:Macro(宏转移)/ Micro(微转移) |
Region[@Id] |
一个连续转移灶(多边形) |
Vertex[@X,@Y] |
多边形顶点(全分辨率像素坐标) |
| (缺失项) | ITC 级病灶无独立 Group——只体现在 slide/pN 标签中 |
坐标为全分辨率像素坐标,无物理单位标注——跨分辨率处理时务必先除以所在层级的下采样倍率(H.2 的常见错误源)。
附录 Q:检索路径示范
| 目标 | 推荐查询式 | 预期命中 |
|---|---|---|
| 数据下载 | CAMELYON17 + site:camelyon17.grand-challenge.org 或 GigaDB 100505 | 官网 Data / GigaDB |
| 数据论文 | “CAMELYON17” + “data collection” + GigaScience | giy065(PMC6007545) |
| 挑战赛总结 | “CAMELYON17” + Bandi + IEEE | DOI 10.1109/TMI.2018.2867350 |
| MIL 基准用法 | CAMELYON17 + “multiple instance learning” + staging | 后续方法文献 |
| 会后口径核查 | Deep Bio + CAMELYON17 + 0.9570 | 新闻稿(注明口径) |
| 反例(勿混) | CAMELYON16 的 FROC 数字用于 C17 | 口径错误 |
附录 R:双口径登记表
| 项目 | 口径 A | 口径 B | 采用规则 |
|---|---|---|---|
| WSI 数 | 1000(挑战赛发放) | 1399(GigaScience 归档) | 任务语境用 A,数据归档语境用 B |
| 体量 | 2.95 TB(归档) | 2314.6 GB(IEEE-TMI 记录) | 论文语境各自对应 |
| 冠军 kappa | 0.8993(正式阶段,TMI) | 0.9570(会后,公司口径) | 排行榜默认 A,B 必须注明 |
| pN2 定义 | 官网 Evaluation 口径(≥4 阳性) | AJCC 通用口径(4-9 枚/其他分支) | 挑战赛语境用官网口径 |
| 伦理批号 | NL48845.091.16(GigaScience) | 2016-2761(部分文件) | 引论文用 A |
| 许可 | CC0 1.0(现行) | CC BY-NC-ND 4.0(挑战期) | 一律用现行 A |
附录 S:维护计划与触发点
- 触发点 1:IEEE-TMI 论文标题/卷期最终比对完成(§10 坑 2 待核项)→ 更新 §6.4/附录 L 与事实清单 28。
- 触发点 2:Deep Bio 口径获同行评审收录或官网正式榜单改版 → 重写 §7.5 与坑 5。
- 触发点 3:官网结构改版(评测服务器下线/渠道变动)→ 更新 §5.2 与附录 D。
- 触发点 4:库内新增 CAMELYON 衍生条目 → 扩 §9.1 家族图谱。
- 例行:每 12 个月核查五条下载渠道可用性与 Google Scholar 引用量。
附录 T:基于本数据集的研究检查清单(12 项)
- 患者级划分:训练/验证按患者切,绝不按切片切(Q24)。
- 口径声明:1000 vs 1399、2.95 TB vs 2314.6 GB,写明(坑 3)。
- 排行榜口径:默认引正式阶段 Lunit 0.8993;Deep Bio 数字必须带"会后补交、公司口径"限定(坑 5)。
- 分辨率对齐:逐张读 mpp 元数据,按物理分辨率重采样(Q29)。
- XML 栅格化校验:转换 mask 后叠加可视化抽查 ≥20 张(H.2 错误源)。
- 阈值敏感性:患者级聚合的每个阈值做敏感性曲线(附录 J 自由度)。
- 分层报告:混淆矩阵按五类全报;重点看 pN0(i+) 行(§7.4)。
- 跨中心分层:按中心报告成绩差值,量化扫描域敏感度(§8.3)。
- ITC 标签加权:ITC 相关结论做抽样人工复核,声明"弱金标准"(Q23)。
- 部署先验:勿把训练分布的 pN 类占比当临床先验(附录 K)。
- 许可核对:现行 CC0;引用 2017 年前中间产物时查旧条款(附录 O)。
- 引用完整:数据引 GigaScience,排行榜引 IEEE-TMI,两者不可互相替代(§5.5)。
附录 U:跨中心域泛化实验设计建议
利用三款扫描仪/五家医院的天然异构,推荐三种设计:
- 留一中心(LOCO):4 中心训练 → 1 中心验证,5 折轮转,报告 kappa 极差——极差即域敏感度。
- 染色归一化消融:同一模型 ± Macenko/Reinhard 归一化,比较跨中心增益——CAMELYON17 上这一项的经典结论是"归一化有增益但不足以抹平域差"。
- 阈值漂移分析:同一模型在五中心的转移检测概率分布不同,固定阈值会系统性偏置某些中心的 pN 计数——分中心校准阈值后再聚合,通常可白拿 0.01-0.03 kappa。
附录 V:引文规范(BibTeX)
@article{litjens2018camelyon17,
title = {1399 H&E-stained whole slide images of human lymph nodes
containing metastatic breast cancer: CAMELYON17 data collection},
author = {Litjens, Geert and Bandi, Pranith and Ehteshami Bejnordi, Babak
and Geessink, Oscar and Balkenhol, Maschenka and others},
journal = {GigaScience},
volume = {7},
number = {6},
year = {2018},
doi = {10.1093/gigascience/giy065}
}
@article{bandi2018camelyon17,
title = {Comparison of deep learning algorithms for tumour lymph node
metastase detection: the CAMELYON17 challenge},
author = {Bandi, Pranith and Geessink, Oscar and Manson, Quirine
and Van Dijk, Marc and others},
journal = {IEEE Transactions on Medical Imaging},
year = {2019},
doi = {10.1109/TMI.2018.2867350}
}
注意:Bandi 条目的标题以 IEEE Xplore 页面为准(坑 2 存照待核项);作者列表取首作者+等(et al.),投稿前按目标期刊格式补全。
附录 W:官方评测服务器使用指南
- 注册 camelyon17.grand-challenge.org 账号(挑战赛后注册仍开放)。
- 定位 Evaluation 页(首字母大写路径),确认当前开放的 algorithm/evaluation 阶段。
- 按平台要求打包推理算法(grand-challenge 平台现行规范为容器化 algorithm 提交;挑战赛年代为结果文件上传,现行以页面指引为准)。
- 评测产出为五类混淆矩阵与 QWK 分数——该分数是唯一可与官方排行榜并列的口径。
- 自建测试注释不能与官方分数混排;论文中两者分表呈现。
附录 X:常见错误用法批判(文献 zombies)
- “CAMELYON17 冠军 kappa 0.95”——口径僵尸:把会后公司口径当正式成绩(坑 5)。
- "1000 张数据集"与"1399 张数据集"互相打架——口径未声明(坑 3)。
- 在训练集上做五折再报"接近 0.9"——泄漏僵尸:按切片而非按患者折叠。
- 用 C16 的 FROC 说 C17 的检测水平——任务僵尸:两代指标体系不同(坑 8)。
- 把训练分布当临床先验——分布僵尸:pN0(i+) 富集 11% vs 临床 <5%(附录 K)。
附录 Y:三代病理 grand challenge 对照总表
| 维度 | CAMELYON16(2016) | CAMELYON17(2017) | PANDA(2020) |
|---|---|---|---|
| 器官 | 乳腺淋巴结 | 乳腺淋巴结 | 前列腺 |
| 任务 | slide 级二分类 | 患者级五类分期 | slide 级 Gleason 分级 |
| 主指标 | AUC / FROC | quadratic weighted kappa | quadratic weighted kappa |
| 规模 | 400 WSI / 110 患者 | 1000-1399 WSI / 200 患者 | ~1.1 万 WSI |
| 主办平台 | grand-challenge.org | grand-challenge.org + ISBI | grand-challenge.org + Kaggle |
| 库内 rid | 694 | 本条目 | 560(+640 衍生) |
附录 Z:评测指标族在五类有序任务上的行为对照
| 指标 | 对类别不平衡 | 对错误距离 | pN 任务适配度 |
|---|---|---|---|
| accuracy | 被多数类主导 | 不敏感 | 差 |
| balanced accuracy | 稳健 | 不敏感 | 中(丢失序信息) |
| macro F1 | 稳健 | 不敏感 | 中 |
| MAE(类距绝对值) | 一般 | 线性敏感 | 良 |
| quadratic weighted kappa | 稳健 | 平方敏感 | 官方采用 |
平方距离权重让"高危漏检"(高分期判成阴性)的代价最大化,与临床后果方向一致——这是官方选择 QWK 的核心理由,也是它后来被 PANDA 继承的原因。
附录 AA:患者-切片映射与数据组织
- 文件命名直接携带映射:
patient_XXX_node_Y.tif形式,患者号即聚合键。 - 每患者的切片数 1-5 张不等,对应手术取材的淋巴结数量——切片数本身就是临床信息,聚合时可作特征但注意测试集同分布假设。
- 训练/测试的患者清单以官网发放列表为准;GigaScience 归档口径(1399 张)含患者全部切片,映射表需按归档 README 重建。
- 建议在实验仓库里固化一张
patient_index.csv(patient_id、slide 数、中心、pN 标签[仅训练侧]、划分标记),全部切分与报告从这张表派生——这是患者级实验可复现性的最小基建。
附录 AB:pN0(i+) 的临床争议小专论
pN0(i+)(仅孤立肿瘤细胞)是五类中最"哲学"的一档:ITC 的临床意义至今存在流派分歧——支持方认为 ITC 提示隐匿转移风险、应影响辅助治疗决策;谨慎方认为 ITC 患者与 pN0 的预后差异在小样本研究中不稳定,且检出率高度依赖切面数量与 IHC 使用强度,本身就是"检查越细发现越多"的观察者效应。
CAMELYON17 把这一档单列成类,等于把争议搬进了算法评测:模型必须对"数十个细胞的病灶"输出与 pN0 不同的分期。结果 §7.4 已经给出——这是全体算法最失败的一类。它留下的开放问题比成绩更有价值:如果连金标准都依赖 IHC 而非 H&E,那么"H&E-only 的 pN0(i+) 分类器"这个任务设定本身,就值得任务设计者在下一版协议中重新审视(例如改为 slide 级 ITC 检测报告而非患者级分期强制判定)。
附录 AC:错误分析表模板(提交后自检用)
| 检查项 | 期望模式 | 红旗 |
|---|---|---|
| 混淆矩阵主对角线 | pN0/pN1/pN2 三类对角质量高 | pN0(i+) 行几乎全空 |
| pN0→pN0(i+) 比例 | 少量(漏检 ITC 属正常) | 大量(阈值过低) |
| pN0(i+)→pN0 比例 | 与 ITC 检出率一致 | 长期接近 100%(ITC 全盲) |
| pN1↔pN2 混淆 | 与淋巴结计数错误率相当 | 单向大量 pN2→pN1(计数上限 bug) |
| 分中心 kappa 差 | ≤0.05 | >0.10(域偏移未处理) |
把这张表附在论文/报告附录里,比单报一个总 kappa 更符合数据集设计意图。
附录 AD:跨数据集组合使用建议
- C17(患者级分期)+ C16(slide 级检测):两段式训练的经典组合——C16 数据练检测头、C17 练聚合头;注意两代图像风格同源但患者不重叠,联合训练时按数据集加权。
- C17 + PCam:PCam 可作检测头的预训练或轻量消融场,但 PCam 无患者结构,不能练聚合。
- C17 + BCSS/BACH:同器官不同任务,适合做多任务正则或自监督中间训练,评测仍以 C17 测试协议为准。
- 通用红线:任何组合都要检查患者泄漏——CAMELYON 家族两代数据患者不重叠,但与个别衍生 patch 集的采样来源要逐一核对(PCam 来自 C16,是安全的;来历不明的 CAMELYON patch 包需核对出处)。
附录 AE:数据集卡(Dataset Card)模板
name: CAMELYON17
homepage: https://camelyon17.grand-challenge.org/
download:
- s3://camelyon-dataset # AWS Open Data, us-east-1
- doi:10.5524/100505 # GigaDB(含校验和)
license: CC0-1.0
task: patient-level pN staging (5-class, ordinal)
classes: [pN0, pN0(i+), pN1mi, pN1, pN2]
splits:
train: 500 WSI / 100 patients # 标签公开
test: 500 WSI / 100 patients # 标签不公开(官方评测)
image_format: TIFF (512px tiles, JPEG-in-TIFF, 0.23-0.25 mpp)
annotation: slide-level XML polygons (Macro/Micro groups)
citation: >
Litjens et al., GigaScience 7(6), 2018, doi:10.1093/gigascience/giy065;
Bandi et al., IEEE TMI, doi:10.1109/TMI.2018.2867350
limitations:
- ITC-level ground truth is H&E-weak (clinical confirmation uses IHC)
- test labels not public; offline test reproduction impossible
- scanner heterogeneity (3 vendors) intentional; report per-center
附录 AF:开源实现与代码检索指引
| 目标 | 检索式 | 说明 |
|---|---|---|
| slide 级检测复现 | camelyon17 + github + detection | 参赛队与后续复现较多 |
| MIL 聚合 | camelyon17 + “multiple instance” + staging | 2019 年后文献普遍附码 |
| XML 解析 | camelyon + xml + mask + github | 优先选带可视化校验脚本的 |
| 域自适应 | camelyon17 + stain normalization + github | Macenko/Reinhard 实现俯拾皆是 |
质量红线:任何第三方实现先核对三件事——类别索引顺序(Q37)、患者级切分(Q24)、XML 坐标层级(H.2)。三处全对再谈分数。
附录 AG:数据质量抽样核查方案(建议 SOP)
- 随机抽 20 张训练 WSI,OpenSlide 打开并检查金字塔层数与 tile 可读性。
- 叠加 XML 注释渲染缩略图,人工确认多边形落在转移区域上(附录 AC 同款校验)。
- 按 patient_index 抽 10 名患者,核对切片数与 pN 标签的可聚合性(如 pN0 患者不应出现 Macro 注释)。
- 抽 3 个中心各 5 张,肉眼比对颜色基调,为染色归一化参数定标。
- 全部通过后再启动训练;核查脚本建议纳入 CI,防止数据更新引入回归。
附录 AH:与临床数字病理工作流的对照
| 工作流环节 | 临床现状 | CAMELYON17 的映射 |
|---|---|---|
| 取材与切片 | 淋巴结逐个取材、多层切片 | 患者内 1-5 张 WSI(切面采样运气已固化) |
| 阅片 | 病理医生逐张镜检,H&E 为主 | 模型替代的正是这一步 |
| 疑难确认 | 疑难灶加做 cytokeratin IHC | 数据不含 IHC——任务的成像极限所在 |
| 报告 | 按淋巴结逐个报告累及情况 | slide 级标签的对应物 |
| 分期 | 汇总成 pN(TNM 之 N) | 患者级五类标签 |
| 质控 | 双签/复核制度 | 2 名病理学家复核 + 主任终审 |
对照读法:CAMELYON17 是把"阅片+报告+分期"三步压缩成一次算法输出的实验;被跳过的"疑难加做 IHC"环节正是 ITC 失败的制度性根源(§7.4、附录 AB)。
附录 AI:常见引用错误正反对照
| ❌ 错误写法 | ✅ 更正 |
|---|---|
| “CAMELYON17 冠军 kappa 0.9570” | “正式阶段冠军 Lunit 0.8993(IEEE-TMI);Deep Bio 会后补交阶段宣称 0.9570(公司口径)” |
| “1000 张数据集,2.95 TB” | “发放 1000 张;GigaScience 归档 1399 张(2.95 TB)”——口径拆开说 |
| “四类 pN 分期” | 五类:pN0/pN0(i+)/pN1mi/pN1/pN2 |
| “ISBI 2018 挑战赛” | ISBI 2017(墨尔本);总结论文 2018-2019 发表 |
| “测试集 AUC 0.9” | C17 不用 AUC;患者级五类用 quadratic weighted kappa |
| “许可 CC BY-NC-ND” | 现行 CC0 1.0(挑战期旧条款) |
附录 AJ:五中心患者分配推算
官方口径为"每中心 100 名训练患者 + 100 名测试患者中的约 20+20",据此推算分配表(出处:官网 Data 页 + GigaScience 中心例数):
| 中心 | 训练患者(约) | 测试患者(约) | 可用例数 | 富余用途 |
|---|---|---|---|---|
| RUMC | 20 | 20 | 130 | 替换/质控 |
| CWZ | 20 | 20 | 144 | 替换/质控 |
| UMCU | 20 | 20 | 129 | 替换/质控 |
| RST | 20 | 20 | 168 | 替换/质控 |
| LPON | 20 | 20 | 140 | 替换/质控 |
| 合计 | 100 | 100 | 711 | — |
"约"字号提醒:各中心实际进入发放集的名额存在微小浮动(官网清单为准),且富余例数同时承担质控替换——这不是均匀切割的合成划分,而是真实病理科库存约束下的分配。
附录 AK:中英术语对照速查
| 中文 | 英文 |
|---|---|
| 孤立肿瘤细胞 | isolated tumor cells (ITC) |
| 微转移 | micrometastasis |
| 宏转移 | macrometastasis |
| 前哨淋巴结活检 | sentinel lymph node biopsy (SLNB) |
| 腋窝淋巴结清扫 | axillary lymph node dissection (ALND) |
| 患者级分期 | patient-level staging |
| 转移灶 | metastatic focus / lesion |
| 全切片图像 | whole slide image (WSI) |
| 染色归一化 | stain normalization |
| 免疫组化 | immunohistochemistry (IHC) |
附录 AL:给审稿人/编辑的 10 条要点
- 报告患者级结果必须写明测试通道(官方服务器 vs 自建验证)。
- 排行榜引用默认正式阶段;会后口径必须标注(坑 5)。
- 检查类别索引顺序(pN 序数),QWK 对排列敏感(H.3)。
- 患者级切分是底线,切片级切分即泄漏(Q24)。
- 五类混淆矩阵必须全报,只报 kappa 不合格(§7.4)。
- 分中心成绩差值是域泛化的必要报告项(§8.3)。
- ITC 相关结论需声明 H&E 弱金标准性质(Q23)。
- 训练分布不能当临床先验引用(附录 K)。
- 数据规模引用先声明 1000/1399 口径(坑 3)。
- 双引用不可缺一:GigaScience(数据)+ IEEE-TMI(结果)。
附录 AM:2017-2026 研究演进小史(趋势层面)
- 2017-2018 复现潮:挑战赛结束后,参赛配置(CNN 检测 + 规则聚合)成为标准起跑线,复现与消融研究密集出现;两篇官方论文在此期间确立了任务与成绩的引用基准。
- 2019-2021 MIL 形式化:注意力式多示例学习兴起,CAMELYON17 的"患者级弱标签"结构被反复用作 MIL 公式化的验证场——患者标签天然是"包标签",切片是"实例",与 MIL 数学结构严丝合缝。
- 2020-2022 域自适应潮:三款扫描仪的异构设计使 C17 成为染色归一化与测试时自适应论文的常客,"跨中心 kappa 差"成为该类论文的标准报告项。
- 2022-2026 基础模型时代:病理基础模型大量把 CAMELYON 家族列入下游评测;患者级分期作为"需要推理聚合"的任务,常被用来区分"检索型"与"推理型"模型能力。
- 贯穿主题:标签噪声审计——ITC 弱金标准问题随时间被越来越多地正面讨论,而非默认接受。
附录 AN:两代排行榜联动解读(与 rid 694 分工)
Lunit 在 C16 与 C17 两代正式阶段连庄,是理解"检测→分期"传导的最佳观察点:slide 级检测质量决定聚合的输入上限,因此 C16 的强队(如 Lunit)在 C17 上保持领先的比率高得多;但传导不是完全决定性的——C16 强队中也有在患者级聚合环节失手而跌出十二强的案例,说明两级能力可分离。本条目不复制 C16 的具体榜单数字(细节见库内 camelyon16 条目 rid 694),只保留演进结论:两代成绩的相关性存在但不饱和,聚合层是独立的竞技场。
附录 AO:本条目事实来源清单(URL 级)
| # | 事实块 | 来源 |
|---|---|---|
| 1 | 任务定义、五类 pN、评测协议 | camelyon17.grand-challenge.org(Data/Evaluation 页,大写路径) |
| 2 | 1000 张发放、200 患者、渠道清单 | 官网 Data 页 |
| 3 | 1399 张/2.95 TB/格式/分布表 | GigaScience 论文 giy065(EuropePMC PMC6007545 全文 JATS) |
| 4 | GigaDB 归档与校验和 | doi.org/10.5524/100505 |
| 5 | AWS S3 渠道 | AWS Open Data 注册表(s3://camelyon-dataset) |
| 6 | 23 队 37 算法/Table I/ITC 分析/组合实验 | IEEE-TMI 总结论文(DOI 10.1109/TMI.2018.2867350,PDF 表格视觉读取) |
| 7 | CC0 1.0 | 官网 Data 页 + GigaDB record + AWS 页三源一致 |
| 8 | Deep Bio 0.9570 | Deep Bio 新闻稿(口径存照,非同行评审) |
| 9 | 伦理批号 | GigaScience 论文伦理节 |
| 10 | 引用量级 | Google Scholar(2026-09-27 存照) |
抓取核验时点:2026-09-27;环境坑存照(PMC 反爬走 EuropePMC REST、位图表格走 pdftoppm+视觉读取)见 FACTS.md §9。
附录 AP:发布前自检记录(编辑部核查单)
| 检查项 | 结果 |
|---|---|
| title 含后缀" — AI-Ready Wikipedia | 千方病案医数集" |
| title/subtitle/data_source ≤255 字符 | ✅(54/135/204) |
| description ≤170 字符 | ✅(113) |
| frontmatter cr:RecordSet 节点式写法 | ✅(含 rai:dataLimitations 六则) |
| 坑点"坑 N:"编号制 ≥5 则 | ✅(坑 1-10) |
| DAIMS 评估表 | ✅(附录 B + §5.3 双视角) |
| 十问十答 | ✅(§1) |
| FAQ 分组连续编号 | ✅(Q1-Q40,A-F 六组) |
| 事实清单硬数字 | ✅(30 条) |
| 术语表 | ✅(26 条) |
| 互链:camelyon16(694) 双向不复制 | ✅(§9.2 + 附录 M 分工表) |
| 旧版 camelyon16-17(33) 存照说明 | ✅(§9.2 + 附录 M) |
| 交叉引用节号核验 | ✅(§5.4→§5.5 等已修) |
| URL 占位 qianfanghub.com/ai-ready-dataset/camelyon17/699 | ✅(frontmatter + 附录 A) |
| 附录字母连续(A-AQ,无跳号) | ✅ |
| 行数 1200-1900 | ✅ |
附录 AQ:AI-Ready 光谱上的定位
| 光谱段 | 条目示例 | 本条目位置 |
|---|---|---|
| 即插即用(HF Parquet/patch 包) | pcam(158)、panda-plus-bench | 未达——无现成 tile 包 |
| 直链全片 + 结构化标签 | 本条目 | 此处:TIFF/XML/pN 三层齐备、CC0 |
| 请求制获取 | panda-plus(640) 掩码层 | 不适用 |
| 平台内评测(标签不下发) | breastpathq(268) 等挑战赛 | 测试侧部分适用(官方服务器) |
定位结论:CAMELYON17 处于"直链全片"段的标杆位——它证明了只要许可(CC0)与归档(GigaDB+AWS)做对,挑战赛数据的 AI-Ready 度可以超过许多为 ML 重新打包的数据集;它的未竟事项(tile 化包、测试标签公开)恰好是后来者 pcam 与平台化评测分别补上的两块拼图。
尾注
本条目由千方病案医数集编辑部按 AI-Ready Wikipedia 规范编写,事实部分经官网、GigaScience 数据论文(EuropePMC 全文)与 IEEE-TMI 总结论文(PDF 表格视觉读取)三源互证;抓取与核验时点 2026-09-27。与库内 camelyon16(rid 694)条目互链且分工不复制;旧版 camelyon16-17(rid 33)已冻结并存照。十项坑点(§10)为本条目生产过程中核验或纠错的真实记录,欢迎读者勘误。
相关数据集导航
以下为站内 AI-Ready 数据集百科中与本词条共享多个主题标签的相关数据集,按相关度降序排列:
- unitopatho — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准 / 肿瘤学
- panda-plus — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准 / 肿瘤学
- panda — 共享标签:医学影像 / 病理图像 / 图像分类 / 肿瘤学
- acevedo-blood — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- bbbc051 — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- herlev-pap — 共享标签:医学影像 / 病理图像 / 评测基准 / 肿瘤学
- sipakmed — 共享标签:医学影像 / 病理图像 / 评测基准 / 肿瘤学
- nct-crc-he-100k — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
- lc25000 — 共享标签:医学影像 / 病理图像 / 图像分类 / 肿瘤学
- medmnist — 共享标签:医学影像 / 病理图像 / 图像分类 / 评测基准
导航说明:本章节由全站统一标签体系自动计算生成(标签重合度算法),双向可达;点击链接可跳转至对应数据集词条。

