
第32届“ACM操作系统原理大会”(SOSP: ACM Symposium on Operating Systems Principles)将于2026年9月29日至10月2日召开。SOSP和OSDI是操作系统领域两个最高水平的国际学术会议,被誉为操作系统界的“奥斯卡”。本次SOSP大会共有390篇论文投稿,62篇被接收,接收率为15.9%。上海交通大学 DNA 存储研究中心论文 “ProbeFS: Hierarchical DNA File Systems via Biochemical Content Addressability and Parallelism” 被会议接收。这是 SOSP 创办 59 年来接收的首篇面向 DNA 存储的工作,也是首个为 DNA 存储提供完整层级文件系统抽象、并把端到端检索延迟降至商用云冷存储量级的系统研究。
背景:DNA 存储缺失层级目录抽象
DNA 存储有三个突出优势:密度极高(理论上限约 455 Eb/g,是硬盘、固态盘的一百万倍以上)、寿命极长(常温干燥下可保存数千年)、能耗极低。它因此被看作大数据时代承载海量冷数据最有前景的介质之一。
但当前 DNA 存储大多只能提供一种“扁平”的存储抽象:每个文件都是彼此独立的对象,用一段 DNA 标签当文件名,靠标签杂交来检索。也就是说,DNA 存储虽然具有“文件”抽象,却缺少真实文件系统赖以组织数据的抽象,即层级目录结构——人们无法在 DNA 文件系统中使用目录(即文件夹)。
挑战:层级带来的“跨文件依赖”

图1:串行路径解析(SPR)与哈希路径解析(HPR)在文件查找与目录重命名上的开销对比
层级目录是计算机文件系统中的基础功能之一,然而将计算机文件系统中对层级目录的设计应用在DNA存储中时,会由于“跨文件依赖”导致一系列挑战。在层级目录中,一个文件的存储位置依赖于其祖先目录。举例来讲,对于“/A/B.txt”文件路径,“/”和“/A” 均为“B.txt”文件的祖先目录。在计算机文件系统中,有两类设计可以读取到“B.txt”(图1):
•串行路径解析(SPR):沿着文件路径逐层解析,即先“/”中找到“A”,再从“A”中找到“B.txt”,每一层就要测序一轮。读取 “/A/B.txt”需要 6 次测序,而且只能串行(即依次执行),目录越深越慢。
•哈希路径解析(HPR):通过哈希函数将整条路径“/A/B.txt”计算成地址,直接读取文件,这只要两轮测序,与路径深度无关;但代价转移到了文件名的修改上。因为每个文件的地址都依赖于它的完整路径,修改一个目录的名称,就得递归地把它名下所有子孙文件逐个找出、读出、再迁移到新地址,而这些操作因为数据依赖无法并行,文件越多越慢。
不管采取哪种设计,都将导致多轮、串行的测序。而测序恰恰是 DNA 存取里最重要的一环,串行的轮数每多一轮,时间和成本就随之成比例增加。于是“层级结构与高效检索能否在 DNA 存储中共存”,成了必须回答的问题。
ProbeFS:将 DNA 视为具有生化介质,而非仅为高密度慢速存储器
文章的核心观察是:以往的设计通常只把 DNA 当成“高密度的慢速存储器”,却忽略了它作为一种生化介质,本身就带着两个可以被系统利用的特性。
•内容可寻址性:DNA 的访问靠沃森-克里克碱基互补配对,一段 DNA 探针能按“内容”(子序列)而非“地址”直接把目标链捞出来,天然省去了 SPR 那种“元数据→地址→元数据→地址”的反复往返。
•大规模并行性:分子在液体里随机碰撞,成千上万次探针-目标杂交可以在同一次反应里同时发生,天然替代了 HPR 那种一个接一个的串行迁移。
循此思路,文章设计了一种面向DNA探针的路径编码,使任意粒度的层级操作,无论是定位单个文件、列出某一层目录,还是递归读取整棵子树,都能在预先不知具体文件构成的前提下,只需一次并行杂交即可完成。基于此编码,文章提出了ProbeFS,实现了三个关键能力:
•基于探针的路径解析:查单个文件时,根据路径编码合成对应DNA探针,一步就把目标元数据精准取出。既不用逐层遍历,也避免了 SPR/HPR 带来的读放大。
•一次性子树检索:罗列目录内容或读取子树时,通过设计对应的探针,通过一次杂交就把同一目录下的所有文件一并提取出来,并且事先无需知道这些文件的名称。
•链式增量更新:DNA 一旦合成就无法原地修改。ProbeFS 不去重新合成整个文件,而是给每次改动追加一条带时间戳的“增量链”;读取时按时间戳把这些“增量链”串起来合并成最新状态。这种增量更新的方法能够大幅度降低文件的小改动导致的合成成本。
验证:从试管到百万文件
团队从三个角度来验证 ProbeFS:
•湿实验:在真实合成的 DNA 池上搭起一棵三层目录树,规模从 5 个文件扩到 30 个文件(已经达到、甚至超过既有 DNA 随机访问演示的规模)。在“取单文件 / 列目录 / 取整棵子树”三种场景下,用生物素探针加磁珠捕获,所有目标文件都被成功取出,浓度比非目标至少高出一个数量级;5 文件场景零假阳性,30 文件场景在化学竞争明显加剧的情况下,每种场景也最多只混进 1 条非目标链。
•大规模热力学仿真:用 NUPACK 把规模一路从 5 推到 10 万文件,三类探针的灵敏度始终是 1.0,特异性在五个数量级的跨度里稳定保持在 0.91 以上(图2);在真实的 Linux 内核源码树上(v6.19.10,9.2 万文件、深度达 12 层),open/ls/find 三类操作的灵敏度全部为 1.00,特异性 0.96–1.00。
•系统级评测:相比传统方法和 DNA 块设备 LiqSD,ProbeFS 把读放大最多降低 5124 倍、串行测序轮数最多降低 54 倍(图3)。基于真实器件时延参数的端到端模型显示,ProbeFS上文件的检索延迟降到 1.3–2.7 小时,把 DNA 文件系统从 SPR/HPR/LiqSD 所在的“深度归档级别”(6.5–24 小时,相当于 S3 Glacier Deep Archive)提升至“标准冷存储级别”,和 Amazon S3 Glacier Flexible Retrieval 这类被商业部署的冷存储相当。

图 2:探针选择性从 5 个到 10 万文件规模下的灵敏度与特异性

图3:ProbeFS 与 SPR、HPR、LiqSD 在读放大与串行测序轮数上的对比
ProbeFS 首次指出了层级文件系统语义和 DNA 存储之间的根本错配,指出“跨文件依赖”是多轮测序开销的根源,并且证明:通过将 DNA 的内容可寻址性和大规模并行性纳入到系统设计中,层级结构和高效检索完全可以在分子介质上共存。ProbeFS是团队继 DNA 块设备 LiqSD [FAST '25] 之后,在 DNA 存储与计算机系统结合方向的又一次深入探索。团队将延续“用生化特性重塑存储系统抽象”的思路,加速 DNA 存储走向实用,进一步推动信息技术与生物技术的交叉融合。
论文信息: Ruihan Li, Yuankun Zhang, Mingkai Dong, Yaya Hao, Fei Wang, Chunhai Fan, Haibo Chen. ProbeFS: Hierarchical DNA File Systems via Biochemical Content Addressability and Parallelism. Proceedings of the 32nd ACM Symposium on Operating Systems Principles (SOSP '26), Prague, Czechia, September 29-October 2, 2026.

