云计算百科
云计算领域专业知识百科平台

单细胞的时代要过去了?每天约1.5亿Token,我们花了100亿token去集中攻破cfDNA:生信研究不能只比谁的图更花里胡哨

过去一段时间,我们团队把相当多的注意力投向了cfDNA。手头这张工作账号的Token活动截图显示:累计101.6亿Token,连续使用64天,日均约1.59亿Token。这只是一个工作账号的统计,不能代表团队所有账号的汇总。

文章目录

    • 一、单细胞的问题,已经不只是“还能测多少细胞”
    • 二、为什么我们看上了cfDNA
    • 三、cfDNA并不与单细胞对立;它甚至需要单细胞
    • 四、为什么说这条赛道“看着简单”,却仍有方法机会
    • 五、从发文章看:不必跟资源型科研硬拼规模
    • 六、从临床看:抽血改变的是决策机会,不是医学定律
    • 七、从商业看:市场会奖励“少折腾”,但不奖励空泛承诺
    • 八、我们希望把这1.5亿Token花在哪里
    • 参考资料与图片来源

如果按OpenAI官方API标准档价格做量级换算,以gpt-5.6-terra为例,输入价格为每百万Token $2、输出为 $12。假设这101.6亿Token中70%为输入、30%为输出,并暂不计算缓存折扣,Token费用约**$50,800(5.08万美元),64天平均约$794/天**。若假设全部按输入计费约$20,320,全部按输出计费约$121,920;估算不含单独计费的工具调用。截图没有模型、输入/输出和缓存拆分,因此这只是估算;Codex Pro订阅不等于实际支付了这笔API费用。

这不是实验结果,也不是一张可以证明研究水平的奖状。它只能说明,我们确实在持续阅读、写代码、复核公开数据、推倒假设,再重新寻找更有价值的问题。

我想把态度讲得直接一些:未来几年,生物信息学最值得投入的地方,未必是把图谱做得越来越庞大。**真正有价值的突破,可能发生在一个很窄的临床问题、一种反复可得的样本和一个长期没有解决好的测量环节之间。**我们把cfDNA放到中心位置,就是因为它恰好处在这样的交叉口。

这不意味着单细胞已经没有价值,更不是鼓励所有人转向同一个赛道。我只是越来越不愿意接受一种论文逻辑:采更多细胞、分更多簇、画更密的通讯网络,文章就自动更深。数据体量值得尊重,但它不能代替问题意识。

一、单细胞的问题,已经不只是“还能测多少细胞”

我做过不少单细胞相关研究,也知道它的贡献。没有单细胞,我们很难在许多复杂组织里区分细胞状态、理解稀有群体,或为后续研究建立可用的参考图谱。空间组学、扰动实验、长读长单细胞和多模态测量也还在快速推进。因此,所谓“单细胞到了技术瓶颈”,更准确地说,是一部分常见的应用型研究写法遇到了边际收益瓶颈。

同一类疾病,继续把十万细胞扩大到百万细胞,当然可能发现原本看不到的稀有状态。但如果每篇文章仍停在“重新聚类—命名亚群—拟时序—细胞通讯—挑一个基因做模型”,细胞数上去以后,核心问题可能没有前进一步。它只是让熟悉的流程运行得更大、更慢,也让图更精致。

更需要警惕的是统计单位错位。**十万个细胞,可能只来自十几位患者。**如果要推断患者间差异,细胞不能自动充当独立患者。Zimmerman等人在《Nature Communications》讨论的“伪重复”问题,正是这种错误会放大显著性、影响可重复性的原因。

我们应该问:这个亚群到底对应哪一类患者?疾病进展时是否稳定存在?采样时间、用药、组织处理方式会不会改变它?能否在独立患者和另一种测量方式里再找到它?如果这些问题答不上来,增添细胞数量带来的更多往往只是分辨率,不一定是解释力。

我期待新一代测序和单细胞测量继续突破:更完整的转录本、更可靠的表观与蛋白信息、更低损伤的空间定位、更可重复的纵向采样。这些进步会改变我们能提出的问题。但在工具到来之前,我们也应该承认:一张颜色越来越漂亮的UMAP,不等于临床问题已经被推进。

二、为什么我们看上了cfDNA

cfDNA是细胞释放到血液等体液中的游离DNA;其中来自肿瘤的部分通常称为ctDNA。它看似只是血浆里短短的片段,背后却叠加了细胞死亡、组织来源、核小体保护、酶切过程、甲基化状态和肿瘤基因组改变。同一管血,既可以问“有没有某个突变”,也可以问“这些片段来自哪里、如何断裂、为什么此时出现在循环中”。

这正是我们觉得基因组学仍有很深空间的原因。序列是底座,但有价值的信息不止碱基改变。片段长度、末端位置、末端基序、全基因组覆盖、核小体相关信号和甲基化模式,都可能提供不同的观察窗口。不过必须强调:片段信号是染色质状态和组织来源的间接线索,不能被直接写成某个患者某个组织的RNA表达或开放染色质实测结果。

2026年一项低深度全基因组测序研究,把拷贝数、片段分布、核小体及末端相关特征放到同一分析框架中,用于癌种来源判别。图里值得看的不是“特征越多越好”,而是同一份血浆测序数据怎样被拆解成互补而可检验的信号。

Moss等人在《Nature Communications》建立了细胞类型甲基化参考图谱,用血浆甲基化混合信号推断cfDNA的细胞来源。这类工作吸引我的地方,不只是“做了一个模型”,而是把“血里检测到变化”推进为“变化可能来自哪个组织、哪类细胞”。

这种“来源”问题可以连接肿瘤,也可以连接移植后组织损伤、炎症或其他器官状态。它不保证每一项研究都能做成临床检测,但它给生信工作提供了一个比“找差异基因”更明确的对象:究竟是哪一类来源的分子发生了变化,变化是否随时间与疾病过程同步。

三、cfDNA并不与单细胞对立;它甚至需要单细胞

更有意思的研究,往往在两种技术相遇时出现。单细胞擅长建立细胞状态的参考地图,cfDNA擅长在不反复取得组织的情况下观察循环中的信号。参考图谱越清楚,我们越有机会从血浆片段中提出有生物学含义的来源假设。

Stanley等人在2024年的《Nature Communications》研究中,就把单细胞转录组参考与cfDNA片段覆盖、核小体相关特征结合,用于推断血浆中的细胞类型贡献,并在癌症等场景中探索疾病相关变化。这项研究不意味着“抽一次血就等于做一次全身单细胞测序”;它说明了组织参考图谱可以服务于更容易重复获得的体液测量。

在我们看来,好的生物信息学不应该按平台划阵营。单细胞告诉我们组织里可能存在什么,血浆告诉我们哪些变化可以被反复追踪;病理、影像和临床记录再回答,这些信号是否真正对应患者的病程。**每种技术测到的都是问题的一部分。**把它们接起来,比争论哪一种“更高级”重要得多。

四、为什么说这条赛道“看着简单”,却仍有方法机会

cfDNA的入门叙事很朴素:抽血、分离血浆、建库测序、做生信分析。公开数据也允许研究者从片段长度、覆盖、末端模式和甲基化等维度提出问题。对一个没有能力自行采集百万细胞的团队而言,选择已有真实患者队列、围绕一个可解释特征做深入分析,确实比复制超大规模图谱更现实。

但“问题入口清楚”绝不等于“测量简单”。肿瘤片段可能在早期极少;有限血量决定了可观察分子数。采血管、离心时间、运输、冻融、建库方法、测序深度和比对策略,都可能改变片段图谱。造血细胞来源的背景,以及年龄相关克隆性造血,也可能让突变信号被误读。

2026年一项长读长cfDNA研究直接展示了前处理问题:部分超长读段更可能来自混入的血细胞裂解,而不是研究者想捕捉的原始血浆片段。测到“新峰”之前,先得排除它是否由采样流程造出来。

这里恰恰有方法学空间。我们更关心的是:一个指标在不同采样批次和中心是否稳定?端点或核小体特征究竟来自疾病,还是实验流程?模型在同一患者的纵向样本上是否有意义?低测序深度下还能保留多少信息?发生阴性结果时,是疾病不存在,还是该患者本来就不向血液释放足够的可检分子?

测序深度也不是一句“低成本就好”可以带过。2026年一项用cfDNA片段组学预测子痫前期的研究,把片段特征与血细胞表达关系、不同测序深度下的稳定性一起检验;其部分特征需要很深的测序才能稳定。这提醒我们:每个特征的成本—稳定性曲线,都应该用实际数据测出来。

以片段长度为例,肿瘤相关片段有时偏短,但“偏短”同时受提取试剂、建库是否保留短片段,以及分析时选用的长度窗口影响。一个实验室里成立的阈值,换一套流程可能就失灵。端点与基序也一样:若不记录采血到分离的时间、不检查白细胞破裂污染,就很难判断分类器究竟学到了生物学变化还是前处理习惯。我们希望方法文章敢于把这些不漂亮的细节放进主结果。

**这些问题很小,也很难。**它们不像“再加一个模态”那样容易写进标题,却决定方法能否真正走出训练集。Stanley等人的另一张结果图展示了癌症场景中的异常细胞类型贡献;这样的解释性分析有潜力,但依然需要疾病特异队列、合适对照和独立验证来区分信号来源。

五、从发文章看:不必跟资源型科研硬拼规模

我们不反对大队列,也不会把“小样本”浪漫化。真正的问题是,资源有限的团队该怎么提出别人愿意认真读的问题。要和拥有跨国联盟、数十万患者、海量单细胞平台的团队拼总量,投入未必划算;但在一个明确场景中把定义、数据、统计单位、机制解释和外部检验做透,仍然有机会贡献扎实的方法或结果。

比如针对某一种治疗,先明确临床决策点是治疗前选择、术后微小残留病灶监测,还是复发预警。然后决定样本应在哪些时间点采集,哪些患者必须有组织测序或病理信息,健康对照是否足够,良性疾病对照是否更关键。最后才决定测突变、甲基化、片段组学,或它们的组合。问题在前,算法在后。

拿“术后会不会复发”来说,设计时要先问:术前血、术后第几周血和治疗期间血,哪些能成对拿到?在医生做治疗决定之前,检测结果能否及时返回?如果患者后来复发,影像、病理和复发时间能否连到同一个人?这几个环节没有打通,哪怕从一管血里提取了上千个特征,模型也可能只是在预测采样时间或中心差异。

公开数据研究同样如此。数据下载量不是队列质量的替代品。原始reads是否可得、有没有真正的双端片段信息、患者与样本是否可以对应、病例和对照是否经过相同流程,这些都应在选题之前核对。把不可用的数据硬塞进一个漂亮题目,后面再复杂的算法也补不上最初的证据缺口。

方法论文也不能只报一条好看的AUC。应当报告患者而非片段或测序reads为单位的训练与验证样本量;锁定阈值后看独立队列;报告不同癌种、分期和肿瘤负荷的表现;检验批次、中心、测序深度和处理时间的影响。真正的增量,不是比一个很弱的对照模型高0.02,而是让临床上原本无法可靠回答的问题有了可复核的答案。

如果连测量本身都缺乏共同标尺,跨中心比较就更困难。2026年的一项研究制备了不同预设甲基化比例的cfDNA候选参考材料,检查实测值与设计值是否一致,并开展实验室间验证。它未替所有cfDNA检测解决标准化问题,却把一个容易被忽略的环节摆到台前。

我们也越来越愿意保留“没有成功”的结果。某个末端特征在训练集有信号、外部队列消失了,就应该追踪原因;某个指标只能区分晚期患者,不能用于早筛,就要承认其适用范围。这样的负结果不一定“好看”,却能帮下一步研究少走弯路。

六、从临床看:抽血改变的是决策机会,不是医学定律

谈液体活检时,我总会想到一个普通患者的反应:假如肝脏有问题,我也不愿意动不动就接受一次穿刺。**“今日割五城,明日割十城”可以写成玩笑,落在患者身上,却是一次次真实的疼痛、风险、排队与等待。**血样的侵入性通常更低,也更适合做多时间点观察;这让我们有机会研究组织穿刺难以密集记录的变化。

但不能因此写成“血液能替代所有组织”。组织病理提供形态、空间位置和诊断依据,血液不一定能回答。血浆检测阴性也不能保证肿瘤阴性。美国FDA对已获批的部分血浆伴随诊断明确提示:当血浆未检出相关标志物、而组织检测可行时,应考虑回到组织检测。FDA Guardant360 CDx说明

敏感度也必须放进场景里说。CCGA研究的一项独立验证中,基于cfDNA甲基化的多癌种检测总体敏感度为51.5%、特异度99.5%;I期癌症敏感度仅16.8%,IV期则达到90.1%。这组数字足以说明:“液体活检灵敏度不低”不能作为一条跨疾病、跨分期的口号。Klein等,Ann. Oncol. 2021

同样要分清任务:上面提到的2026年低深度cfDNA研究,在已经患癌的独立验证队列中,对癌种来源的首选预测准确率为80%、前两名命中率为90%;I期首选准确率低于IV期。这是癌种来源判别,不是无症状人群的早筛敏感度。

真实人群还会考验阳性结果的意义。PATHFINDER前瞻性队列中,6,621名参与者有92人出现癌症信号,最终35人确诊;阳性预测值为38%,特异度为99.1%。这并不否定早筛潜力,但说明筛查后的复核、影像和诊断路径本身也是产品的一部分。

2026年公布的PATHFINDER 2更进一步:在32,007人的性能分析集中,报告阳性预测值60.3%、特异度99.64%;对12个月内确诊的全部癌症,研究报告的事件敏感度为39.3%。这项前瞻性研究描述了检测表现与阳性后的诊断过程,不能据此宣称已证明降低癌症死亡率。

另一方面,真正让人看到临床决策价值的例子,来自更具体的问题。DYNAMIC随机试验纳入455名II期结肠癌患者,术后ctDNA指导组接受辅助化疗的比例为15%,标准管理组为28%;2年无复发生存率分别为93.5%和92.4%,达到了试验预设的非劣效标准。此后报告的5年无复发生存率分别为88%和87%。它证明的是在这一特定人群、检测方案与决策流程下,ctDNA信息可以帮助调整治疗使用,而不是“所有癌症都可以一管血解决”。DYNAMIC原始试验|5年随访

七、从商业看:市场会奖励“少折腾”,但不奖励空泛承诺

液体活检的市场前景,我认为确实可观。理由不需要建立在夸张的市场规模预测上:更容易获取的样本、重复检测的可能性,以及已经出现的明确临床使用场景,本身就足以支持长期需求。美国FDA批准的血浆伴随诊断已覆盖若干特定癌种、基因标志物和药物组合,说明这并非只有论文没有路径的概念。FDA伴随诊断清单

但我不会说“抽血一定比组织检测更便宜”。一次穿刺和一次抽血的操作成本不同,整条诊疗路径的成本却还包括采样、建库、测序、算法、质控、复检、影像、误报后的检查、漏报造成的延误,以及支付方能否承担。若一个产品技术上可行,却让医生面对一份无法解释的报告、让患者为每次追踪承担高额费用,市场不会因为“无创”两个字自动买单。

患者愿不愿意用,也与报告的可理解程度有关。阴性意味着什么?需要多久再测一次?阳性是否必须转到影像或组织确认?如果临床无法说明这些问题,抽血虽然方便,仍可能造成持续焦虑。对企业而言,采样便利是入口,真正形成长期价值的是可靠解释、可执行的后续路径和支付方看得懂的结局改善。

真正有竞争力的产品,应该把临床问题定义得很窄:给谁用,在什么时候用,阳性后怎么办,阴性后怎么办,比现有流程增加了什么价值。在特定靶向药物选择中,它可能帮助更快获得分子信息;在术后随访中,它可能帮助识别需要更密切观察的人;在早筛中,则必须把误报、漏报和后续诊断流程一并验证。不同场景不能用同一个“液体活检”标签抹平。

至于汗液等更容易采集的体液,我很愿意关注。它们在代谢物、蛋白或可穿戴传感方面已有探索,乳腺癌汗液挥发物研究也已有21名患者的小规模初步尝试。但汗液研究不能被直接等同于血浆ctDNA临床检测;采样量、目标分子浓度、污染、个体差异和临床验证都还要过关。把远景写清楚,反而比把所有非侵入式体液并列成“成熟市场”更有说服力。汗液诊断综述|乳腺癌汗液挥发物初步研究

八、我们希望把这1.5亿Token花在哪里

Token的消耗可以很大,问题却应该越来越小。我们希望把工作压在几个可检验的方向:cfDNA片段特征怎样与组织来源相联系;纵向变化能否比一次性分类更早、更稳地反映病程;何种预分析条件会让一个漂亮的信号失真;一个公开队列中观察到的关联,换一个中心、换一套流程,还剩下多少。

具体做起来,第一步往往很不浪漫:列清楚每一个公开数据集的来源、真实患者数、采样时间、治疗信息、可用的原始文件和不能回答的问题。数据表里写着“血浆样本”并不代表能做片段组学;缺少双端信息、无法确认建库方法,或同一患者多个时间点无法对应,都可能直接改变课题边界。把这些基础工作做好,比提前想好一个惊艳标题更重要。

第二步,是和临床伙伴把问题问得足够具体。医生说“想预测疗效”,我们会继续问:预测的是影像缓解、无进展生存,还是某次治疗之后的早期风险?结果要在几天内返回才有用?错判阳性和错判阴性,哪一种对患者更难承受?算法只有进入这样的对话,才有机会成为决策工具;否则它只是一个离开电脑就不再产生作用的分数。

第三步,是把每一个看似微小的改进留下可追溯的依据。新的片段特征比旧特征好在哪里,差异是否来自同一批患者的公平比较,换一个公开队列是否仍成立,都需要留下代码、参数和排除记录。我们不准备靠“每天用了多少Token”来回答这些问题。Token只是工具运行留下的痕迹,真正的进度应当体现为更干净的数据、更明确的边界和更可检验的结论。

这些工作最后要落到真实的患者单位上。病例数不够就说不够,样本之间没有配对就不说配对;只有相关性就不写成机制证明;模型在外部队列失败,就把失败作为下一轮方法改进的起点。AI可以帮助我们读得更快、试得更多,但它不能把缺少的患者、缺失的时间点和不存在的临床验证凭空补出来。

我仍然相信单细胞,也期待更先进的测序和空间技术。只是现阶段,我们愿意把更多时间放在cfDNA这样一条相对不拥挤、入口清楚、却尚有许多硬问题的赛道。对我们来说,生物信息学最好的样子,是把复杂测量变成对具体疾病过程更可靠的认识,再让这种认识有机会减少患者不必要的侵入性操作、无效治疗和等待。

日均约1.5亿Token,值得讲,但真正值得交代的是它将换来什么。希望下一次展示的,不只是使用量的截图,而是一项经得住跨队列验证、能回答清楚临床问题的cfDNA结果。

参考资料与图片来源

  • Zimmerman KD, et al. A practical solution to pseudoreplication bias in single-cell studies. Nat. Commun. 2021. 。图2使用其Fig. 1,CC BY 4.0。
  • Zhang等. Integrative cfDNA profiling from low-pass whole-genome sequencing enables tissue-of-origin prediction in cancer. Mol. Biomed. 2026. 。图3、图10使用其Fig. 1、Fig. 3,CC BY 4.0。
  • Moss J, et al. Comprehensive human cell-type methylation atlas reveals origins of circulating cell-free DNA in health and disease. Nat. Commun. 2018. 。图4使用其Fig. 1,CC BY 4.0。
  • Stanley KE, et al. Cell type signatures in cell-free DNA fragmentation profiles reveal disease biology. Nat. Commun. 2024. 。图5、图8使用其Fig. 1、Fig. 4,CC BY 4.0。
  • Berman等. Long-read sequencing identifies aberrant fragmentation patterns linked to elevated cell-free DNA levels in cancer. Genome Biol. 2026. 。图6使用其Fig. 3,CC BY 4.0。
  • Xu等. Cell-free DNA fragmentomics for preeclampsia risk assessment. Nat. Commun. 2026. 。图7使用其Fig. 1,CC BY 4.0。
  • He等. Development, characterization, and inter-laboratory validation of methylated human cell free DNA candidate reference materials. Clin. Epigenetics 2026. 。图9使用其Fig. 4,CC BY 4.0。
  • Klein EA, et al. Clinical validation of a targeted methylation-based multi-cancer early detection test using an independent validation set. Ann. Oncol. 2021. PubMed。
  • Schrag D, et al. Blood-based tests for multicancer early detection (PATHFINDER): a prospective cohort study. Lancet. 2023. PMC全文。
  • Nabavizadeh等. Performance and safety of a multi-cancer early detection test: the PATHFINDER 2 study. Nat. Med. 2026. 。图11使用其Fig. 2,CC BY 4.0。
  • Tie J, et al. Circulating Tumor DNA Analysis Guiding Adjuvant Therapy in Stage II Colon Cancer. N. Engl. J. Med. 2022. 。5年随访。
  • 美国FDA. 已获批伴随诊断清单;Guardant360 CDx监管说明。
  • cfDNA检测的技术限制综述;汗液作为诊断体液的综述;乳腺癌汗液挥发物初步研究。
  • 赞(0)
    未经允许不得转载:网硕互联帮助中心 » 单细胞的时代要过去了?每天约1.5亿Token,我们花了100亿token去集中攻破cfDNA:生信研究不能只比谁的图更花里胡哨
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!