人类所有细胞都含有相同的基因组,但它在每种细胞中的运作方式却截然不同。有些细胞产生酶,有些产生激素,还有些形成骨骼和结缔组织的坚固支架。差异并非源于基因本身,而在于它们何时开启、以何种强度开启并工作。这个生物学基本问题长期以来一直引起科学家的兴趣。现在,加州大学圣迭戈分校的研究人员找到了一种新方法,通过应用人工智能来揭示这一奥秘。
在詹姆斯·T·卡多纳吉教授的领导下,团队利用机器学习来解读关键的“启动”DNA区域——即标记基因读取起始位置的启动子。该研究由研究生托雷·莱恩-卡里格牵头,他与同事对约五十万个启动子序列变体进行了高通量测序,并训练了一个机器学习模型来识别其特征模式。结果表明,大约在60%个集中型人类基因启动子中存在活性启动子——这高于先前基于相似序列搜索的估计,后者约为40–56%。新数字更为可靠,因为它基于实验测量,而非简单的模板搜索。
该模型首次能够高精度地预测基因组中启动子的存在,并解读转录起始所需的最小功能序列。这意味着科学家现在可以查看一段DNA,并判断它是否会作为活性启动子发挥作用——这样的工具以前是不可能实现的。
这一发现具有重要的实际意义。启动子中的突变会破坏基因的正常激活,并可能促进疾病的发展,包括癌症。新模型使得在活细胞实验之前就能评估这些变化的影响——这节省了时间和资源,并帮助医生更准确地预测突变对每个特定患者的影响。此外,解读出的启动子特征为生物技术专家开辟了道路,使他们能够创建具有可预测特性的合成启动子,用于靶向治疗和基因工程。
人类基因组包含约3亿个碱基对——这是一份庞大的指令,其中编码了规则:每个20个000–25000基因应在何处、何时以及以何种数量工作。启动子只是控制这一过程的众多调控元件之一。基于启动子训练的模型是解读分子调控“语言”的第一步。科学家指出,未来他们计划将研究扩展到基因组中其他重要的调控元件:增强子(增强基因活性)和沉默子(抑制基因活性),以全面了解基因在不同细胞中如何开启和关闭。
这项研究发表在权威期刊《基因与发育》31月2026年刊上,是多年工作中重要的一步,旨在构建完整的人工智能来解读人类基因表达密码——即决定哪些基因在何时、在哪些细胞中开启的完整指令集。实际应用已近在眼前:医生将能更准确地预测突变的影响,而生物技术专家将获得构建具有指定特性的人工调控序列的工具。
理解决定哪个基因在适当时候以适当数量“开启”的机制,使我们更接近更精准的个性化医疗。这有助于回答生物学的基本问题:为什么相同的DNA能在单一生物体内产生如此惊人的细胞、组织和器官多样性。


