介绍
合成数据是生成的,而不是直接观察到的。它可以代表人、交易、机器、环境、图像、信号或事件。当真实数据稀缺、敏感、昂贵、收集危险或不平衡时,公司使用它来开发模型。他们还用它来测试软件、模拟边缘情况、创建数字孪生、支持研究以及构建可以评估新产品的沙箱。
商业利益并不决定估值。同一供应商可以出售软件订阅、数据集许可证、定制生成项目、验证服务以及对特定领域数据交换的访问。每个收入来源都取决于不同的资产,并具有不同的利润率、更新风险和负债。将单一软件倍数应用于所有报告收入的买家可以支付咨询费用,就好像它是经常性知识产权一样。
技术主张还包含相互竞争的目标。更强的隐私保护会降低效用。更高的保真度可以保留不必要的偏差或使源记录更容易推断。生成器可以在全球统计指标上表现良好,但无法完成客户的实际任务。可重复的管道可以持续地重复错误的群体。客户可以接受用于开发的合成数据,并拒绝用于生产验证或监管证据。
NIST 指出,没有差异隐私的合成数据仍然容易受到隐私攻击,并且效用挑战可能会影响子群体和下游推理 [9-12]。 ICO 将合成数据视为一种隐私增强技术,其风险和有用性取决于实施和背景 [13-15]。欧盟 AI 法案涉及监管沙箱受控条件下的匿名、合成和其他非个人数据 [18]。 FDA 和 EMA 材料表明,监管机构的接受是针对特定用途和特定证据的 [23-27]。
本文专为董事会、企业发展团队、私募股权和风险投资者、创始人、贷款人、估值专家、客户和整合领导者而设计。它提供了一个交易决策系统。它不提供法律、监管、会计、税务、临床、技术安全或估值建议。适用规则、产品声明、客户合同和技术证据需要针对特定目标的专业审查。
1 定义公司及其资产堆栈
合成数据公司在估值之前应该进行分解。第一资产可以是生成器:统计的、基于模拟的、基于代理的、基于规则的、生成的或混合的。第二个可能是用于校准发生器的源数据资产。第三个可能是衡量效用、隐私、保真度、偏见和可重复性的评估系统。其他资产可以包括领域本体、场景库、渲染管道、数字孪生模型、编排软件、客户连接器、验证协议和专业人员。
资产图应识别目标控制的内容以及仅访问的内容。公司可以在受限条款下对客户数据进行训练,从第三方许可模拟器,依赖开源基础模型或使用其经济和权利可能发生变化的云服务。买方应确定每种依赖性、其可转让性、控制权变更的影响以及可靠替代品的成本。
记账单位应遵循客户的建议。为许多机构服务的可重复使用的平台可以与受监管的医疗模块、自动驾驶场景库或金融犯罪测试包分开进行分析。这些产品可以共享代码,但在源代码权利、域验证、销售周期、责任和经济寿命方面有所不同。将它们结合起来隐藏了客户付费的原因。
资产可以创造价值,无需在财务报表中单独确认。 IAS 38 侧重于可识别性、控制权和未来经济利益,而 IFRS 3 则关注在企业合并中获得的可识别资产[1-3]。因此,交易价值、购买价格分配和内部投资决策需要相关但不同的分析。
| 资产构成 | 需要检查的证据 | 经济作用 | 主要估值问题 |
|---|---|---|---|
| 一代发动机 | 架构版本 培训记录 许可证和可重现的构建 | 创建综合观察或场景 | 它是否优于客户任务的可靠替代方案 |
| 源数据访问 | 合同 通知 权限 沿袭保留和转让条款 | 校准分布依赖性和罕见事件 | 买方能否继续合法且技术上充分的访问 |
| 评价体系 | 指标阈值基准治理和独立结果 | 展示实用程序的隐私和限制 | 与决策相关的测试是否可重复并且能够抵抗游戏 |
| 领域模型和本体 | 专家方法验证历史和版本控制 | 编码关系约束和场景 | 如果没有现有的专家,还有多少优势可以生存 |
| 工作流程整合 | 连接器部署控制文档和支持数据 | 将产品嵌入客户运营中 | 集成会产生什么转换成本和重复采用 |
| 证据和保证体系 | 审核跟踪批准事件模型卡和报告 | 支持采购风险和监管审查 | 随着产品数据和规则的变化,证据可以更新吗 |
拟议的尽职调查记录;专家应确定每项资产的合法会计隐私安全和监管处理。
2 从客户决定和预期用途开始
效用仅在与任务相关时才有意义。 NIST 在效用指标方面的工作强调,没有任何单一指标可以为每项分析确定有用性 [10-12]。适合教学的综合群体可能不适合学分决策。足以测试软件界面的数据可能不适合估计治疗效果。改善边缘情况覆盖的自动驾驶场景可能并不代表现实世界的频率。
买方应该重建客户的工作。它应该识别消耗数据的决策、模型、测试或模拟;人口和经营条件;性能阈值;错误结论的成本;以及接受所需的证据。由于错误的后果和替代选项不同,相同的合成数据集在不同客户中可能具有不同的价值。
效用测试应包括描述性统计、多元关系、任务绩效、子组绩效、罕见事件覆盖率和现实扰动下的稳定性。相关测试通常在下游进行。如果客户使用这些数据来训练分类器,则买方应检查独立的真实世界保留数据的性能。如果客户使用它来测试支付系统,买方应检查缺陷发现和发布结果。如果客户将其用于场景模拟,则买方应检查是否代表了关键状态和转换。
尽职调查团队还应该确定客户的后备方案。仅当合成产品相对于可用替代品改变成本、速度、覆盖范围、风险或收入时,公用事业才具有经济价格。银行可以将合成欺诈语料库与屏蔽生产数据、手动场景设计和专业测试数据供应商进行比较。医疗设备开发商可以将生成的图像与预期收集、回顾性许可和更窄的产品声明进行比较。工业客户可能会将数字孪生与物理测试和保守的操作限制进行比较。交易模型应记录哪些替代方案被取代、哪些成本仍然存在以及哪些收益取决于客户的采用。
接受证据应该是基于队列的。供应商可能会表现出强大的总体基准测试结果,而只有少数客户达到生产使用。买方应将每个材料试点与其预期任务、商定的阈值、验证结果、生产决策、验收时间和后续更新进行协调。失败的试点也值得同样的关注,因为它们揭示了不受支持的用例、销售资格弱点和隐藏的实施成本。如果没有记录在案的桥梁,则不应将一项任务或群体的证据转移到另一项任务或群体。
客户验收记录比供应商的基准更有说服力。买方应检查已投入生产的试点、记录拒绝原因、采购条件、验证报告、使用日志、更新证据以及根据综合结果采取的操作行动。签订的实验合同并不能证明数据已进入材料工作流程。

拟议的交易框架;每一支箭都需要针对具体目标的证据。
3 测试隐私声明作为工程证据
合成这个词并不意味着匿名。经过个人或机密数据训练的生成器可以复制源记录、保留罕见的组合、揭示成员资格或使属性可推断。隐私风险取决于源群体、生成器、访问模型、对手能力、发布字段、查询接口和从其他来源获得的信息。
NIST SP 800-226 解释说,没有差异隐私的合成数据方法通常提供非正式的保证,并且可能仍然容易受到隐私攻击 [9]。差分隐私为限制隐私损失提供了一个数学框架,但实现仍然需要检查邻接性、隐私单位、epsilon、delta、组合、裁剪、随机性、会计和软件行为。如果没有这些细节,产品具有差异性隐私的营销声明是不完整的。
买方应检查攻击测试。有用的测试可以包括精确和近似记录匹配、成员推断、属性推断、最近邻分析、金丝雀暴露和重建尝试。设计应反映现实的对手和辅助信息。通过一次攻击测试并不能防御所有攻击。失败的测试应该定义修复、版本控制和客户通知规则。
应在整个产品生命周期中评估隐私。即使最终数据集通过了发布测试,源数据摄取、临时文件、模型检查点、日志、支持票证和客户导出也可能会造成暴露。买方应明确个人或机密信息的输入位置、哪些系统保留这些信息、谁可以访问这些信息、这些信息持续多长时间以及删除请求或合同限制如何传播。 NIST 的隐私框架和 ENISA 的数据保护工程材料支持将隐私视为受治理的系统而不是最终输出标签 [43-45]。
商业条款应反映实际交付的保证。客户可以接收数据集、托管查询环境或托管服务,其中供应商控制访问并监控使用。这些模型创建了不同的攻击面和义务。尽职调查团队应将合同承诺与经过测试的控制、保险、事件程序和技术限制进行比较。匿名、隐私安全或无风险等广泛的声明应追溯到精确的方法、经过测试的发布和批准的客户使用。
隐私和实用性应该一起评估。通过销毁决策相关信息来保护隐私的公司可能不会创造什么经济价值。最大限度提高保真度的公司可以增加隐私暴露。交易模型应该使用边界而不是单一分数:在每个隐私设置下实现什么效用,针对哪个任务、人群和访问模式?
| 宣称 | 需要证据 | 失效模式 | 交易后果 |
|---|---|---|---|
| 记录是匿名的 | 威胁模型攻击测试联动分析和发布控制 | 可识别或挑选的信息仍然存在 | 排除受影响的收入并要求补救或访问限制 |
| 使用差异隐私 | 正式机制隐私单位预算会计代码和测试结果 | 参数或成分的选择削弱了保证 | 对索赔进行概率加权并施加技术成交条件 |
| 源数据被最小化 | 现场必要性保留访问和删除证据 | 不必要的敏感属性保留在训练或日志中 | 包括补救成本和客户同意风险 |
| 客户可以安全地共享输出 | 输出策略查询限制监控和合同控制 | 重复查询或连接会增加披露 | 减少规模假设和资金控制基础设施 |
| 隐私保持稳定 | 回归测试事件历史和变更治理 | 新模型或来源群组改变了暴露 | 缩短经济寿命并需要持续的保障支出 |
说明性测试设计;隐私专家和律师应确定适当的方法阈值和法律结论。
4 要求可重复性和出处
再现性是商业控制。买方应该能够根据已识别的源版本、代码、配置、随机种子、环境、模型权重和批准记录重建材料数据集。它还应该了解哪些输出是故意随机的,以及重复运行被认为是等效的容差。
可重复的管道支持客户保证、事件调查和产品维护。它允许公司解释为什么更新的数据集与之前的版本不同。它还允许买家测试性能结果是否取决于隐藏的手动干预、特定工程师或不可用的源数据。再现性并不要求每次运行都有相同的记录;它需要受控的变化和可审计的过程。
出处应将每个输出队列与源类别和转换联系起来,而不暴露受保护的源记录。记录应确定源时期、总体、排除、预处理、生成器版本、校准设置、质量门控和发布批准。当领域专家添加规则或场景时,应记录这些干预措施并进行版本控制。
洁净室测试应在管理层选择示范之前设计。买方控制的团队应该选择一个有代表性的产品,并用目标公司保存的材料重建它。它应该记录不可用的依赖项、手动步骤、环境漂移、运行时间、成本和输出差异。在预期出现随机变化的情况下,测试应提前定义可接受的分布和任务性能范围。对特定员工的无法解释的要求、未记录的提示或无法访问的客户文件都是可转移风险。
再现性也会影响资产的有效经济寿命。可以重建、重新测试和适应新源周期的产品可以支持更新和相邻用例。如果产品的证据与过时的环境或一次性数据快照相关,则可能需要大量的再投资。因此,评估应该将模型维护和重新验证与普通软件支持分开,并在图书馆、隐私设置、法规或客户群体发生变化时提出明确的现金要求。
买方应对代表性产品进行洁净室重建。测试应使用受控访问和不操作原始管道的团队。它应该比较输出特征、任务性能、隐私结果、运行时间、计算成本和异常。成功的重建增强了可转移性的证据。失败可能表明技术诀窍未记录、文物丢失或依赖于关闭后可以离开的人员。

提议的控制架构;实施应反映目标的技术和风险状况。
5 衡量保真度代表性和故障覆盖率
保真度描述了合成数据保留与预期用途相关的特征的程度。它不是单一财产。当依赖失败时,边际分布可以匹配。聚合准确度可以隐藏子组错误。生成器可能会生成看似合理的常见案例,但会错过推动客户价值的罕见事件。视觉现实主义可以与不正确的物理或商业逻辑共存。
评估设计应该从一般证据转向针对特定任务的证据。一般测量可以比较分布、相关性、距离和分类器的可区分性。领域测量可以测试临床关系、财务约束、物理定律、序列有效性或因果结构。任务度量可以测试在合成数据上训练的模型是否在独立的真实数据上执行,是否发现软件缺陷以及模拟是否预测观察到的结果。
应针对部署人群(而不仅仅是训练样本)来评估代表性。 NIST 的 AI RMF Playbook 将评估与使用环境和分类性能联系起来 [28-30]。综合生成可以重新平衡代表性不足的群体,但当源数据稀疏或有偏差时,它也可能放大错误。因此,罕见事件合成需要领域审查和样本外验证。
买方应检查故障范围。用于测试欺诈控制、工业安全或自主系统的产品的大部分价值可能来自现实的边缘案例。公司应该展示如何选择场景、如何检查合理性、如何防止重复以及如何将结果与事件或真实观察结果进行比较。仅凭情景计数是薄弱的证据。
| 测试层 | 证据示例 | 它可以建立什么 | 它无法单独建立什么 |
|---|---|---|---|
| 模式和规则 | 类型范围引用完整性和域约束 | 结构可用性 | 统计或任务保真度 |
| 单变量保真度 | counts 表示分位数类别和缺失 | 边缘相似度 | 关系和罕见事件行为 |
| 多元保真度 | 相关性条件分布和相关性检验 | 保留选定的关系 | 因果有效性或部署性能 |
| 亚组和罕见事件 | 分类指标场景覆盖率和错误率 | 总分可能掩盖弱点的表现 | 超越测试群体的完全代表性 |
| 下游任务 | 训练-综合-测试-真实或系统测试结果 | 对于定义的模型或工作流程的有用性 | 对其他目的的有用性 |
| 运营成果 | 发现缺陷的周期时间验收并收集效益 | 实现的客户价值 | 未来的耐久性无需持续监控 |
拟议的证据层次结构;阈值应根据预期用途和错误后果来定义。
6 按用例单独监管接受
监管接受应被视为一种途径,而不是一个标签。监管机构可以接受用于软件测试、方法开发或补充的合成数据,同时要求安全性、有效性或市场行为的真实证据。产品的价值取决于具体的索赔、决定和管辖权。
欧盟 AI 法案规定了高风险系统的要求并创建了监管沙箱。第 59 条涉及当匿名、合成或其他非个人数据无法有效满足要求时,在某些公共利益沙箱用例中进一步处理个人数据 [18]。这种结构表明,合成数据可以成为相关证据,并且其充分性仍然与上下文有关。
FDA 材料区分分析证据、临床证据和软件证据。该机构在支持生成 AI 的设备上的工作询问合成输入应如何补充真实患者数据、应如何处理分布差异以及基准何时预测安全有效的现实世界行为 [23-25]。 EMA 2026 年至 2028 年工作计划包括审查合成数据和数字孪生作为现有临床数据的潜在补充 [26]。这些材料支持勤勉问题;他们不为任何供应商建立预先批准。
监管证据应表示为用例矩阵。行可以识别产品、管辖范围和客户决策。列可以识别适用的机构、所需的证据、当前提交状态、接受的限制、监控义务和责任所有者。这种结构阻止了探索性沙箱参与、客户合规审查和正式监管决定被视为等同。 FCA 和伦敦金融城沙盒材料同样表明,受控实验可以在规定条件下提供数据访问和测试支持;参与本身并不代表市场范围内的认可[21-22]。
当达到明显的里程碑时,估值模型应释放监管现金流。开发模块可以接收记录的验收路线的概率加权值。获得客户重复认可的生产模块可以获得更大的权重。依赖于未经测试的向新管辖区、人口或决策的扩张的收入应该仍然是一个单独的场景。该模型应包括提交、独立研究、监控、模型变更和客户保证的成本,而不是将接受视为无成本的转换。
在金融服务领域,FCA 的数字沙盒使用合成数据来支持实验,公共材料描述了用于制裁筛选测试的合成数据工具 [21-22]。商业价值仍然取决于客户的合规性、模型风险和审计团队是否接受该产品用于既定的控制目的。

说明性途径;主管当局和专家顾问确定实际证据要求。
7 重建收入质量和可持续盈利
买方应按产品、客户和证据负担对收入进行分类。当生成和评估可重复使用时,平台订阅可以带来有吸引力的毛利率。数据集许可证可以是定期的或间歇性的。定制项目可以包含有价值的学习内容,并且仍然像咨询一样。托管验证服务可以通过劳动密集型交付产生经常性收入。
报告的年度经常性收入应与已执行的合同、计费、使用和续订条款进行核对。分析应确定最低承诺、可变计算、专业服务、试用期、终止权、接受条款和客户集中度。如果没有续订和持续使用的证据,依赖于一次性数据构建的收入不应被视为永久订阅收入。
毛利率应包括生成和保证的全部成本:云计算、源数据许可证、领域专家、隐私测试、质量审查、客户特定的校准、支持和监管文件。资本化开发或共享研究成本应单独分析。当重要的技术工作记录在底线以下时,高会计毛利率可能会夸大经济性。
客户集中度应通过收入和产品依赖性来考察。一个客户可以在提供基本的来源访问权限、验证专业知识或其他销售中使用的参考凭据的同时,占据一定的收入份额。买方应确定合同结束时的权利、对衍生制品的限制,以及在合作期间训练或校准的模型是否可以为其他客户服务。更新分析应将持续的产品价值与转换摩擦、资助资金、创始人关系和合同通知期分开。
现金转换需要合同级别的桥梁。里程碑计费、接受权、计算传递、服务积分、数据保留义务和延迟验证可能会使已确认的收入成为所收集现金的弱指标。该模型应比较预订、已确认收入、发票、收款、递延收入、未开票工作和实施劳动力。预测应承担与每个用例相关的营运资金和保证负担,特别是在受监管的客户保留付款直至验证完成的情况下。
应按预期用途对客户群体进行比较。低风险测试产品的更新可能无法预测受监管模块的更新。通过创始人参与赢得试点的公司可能会面临规模限制。买方应检查验收时间、实施工作、产品使用、扩展、支持负载、流失原因和现金回收。
| 收入等级 | 复发的证据 | 服务成本 | 估值处理 |
|---|---|---|---|
| 核心平台订阅 | 合同期限使用保留和标准部署 | 计算支持和持续的产品保证 | 如果证明更新和采用,则经常性软件现金流 |
| 域模块许可证 | 在经过验证的工作流程和更新的证据中重复使用 | 域维护验证和源校准 | 具有特定用途风险和经济寿命的模块现金流 |
| 数据集交付 | 重复购买刷新时间表和可转让权利 | 生成回顾存储和分发 | 仅当刷新需求和权利持久时才会重复 |
| 定制生成项目 | 积压里程碑验收并转换为可重复使用的产品 | 专业劳动力客户特定工程和返工 | 除非有证据表明重复使用和更新,否则项目现金流量 |
| 验证和保证服务 | 合同审查周期和标准化方法 | 隐私质量监管和领域工作人员 | 受劳动力和利用率限制的服务现金流 |
| 沙盒或试点 | 资助范围验收和生产转换 | 高支持和售前工作 | 转换之前的选择证据而不是经常性收入 |
说明性分类;交易模型中的金额是管理层假设而非市场证据。
8 建立重置成本指标
成本法询问理性买家今天会花多少钱来创造具有同等效用的资产。历史开发支出是一个起始记录,可能包括失败的实验、低效的代码、被遗弃的市场以及新进入者会避免的学习。因此,重置成本应该重建当前的工作计划,而不是资本化过去的每一项费用。
分析应将源获取、权利许可、工程、领域建模、评估、隐私保证、监管文档、客户集成和商业准备时间分开。当时间影响市场准入或客户保留时,它应包括延迟的机会成本。当更新的方法可以以更低的成本重现相同的结果时,它应该扣除功能过时。
复制和替换是不同的。复制再现了相同的平台和证据。更换通过最佳可用方法创造同等的客户效用。买家可以用真实数据、模拟、开源工具、专业供应商、客户提供的数据或更小的混合系统来替代。即使目标花费更多,最便宜的可信路线也会限制价值。
说明性的替换构建使用管理假设。工程和模型开发成本USD 7.0 million。源访问和合法校准成本 USD 4.0 million。域建模成本 USD 3.5 million。效用、隐私和偏见评估成本 USD 3.0 million。客户连接器和证据包的成本为 USD 2.5 million。项目管理和失败迭代添加USD 2.0 million。两年的时间调整增加了 USD 4.0 million,而可避免的遗留架构和重复工作减少了 USD 2.0 million 的指示。由此产生的重置成本指示为 USD 24.0 million。

USD 百万;每个金额都是一个管理假设,仅用于演示该方法。
9 根据可接受的使用情况建立收入指标
收益法应从依赖于合成数据资产的现金流开始。它应该避免将整个公司的收入分配给发电商。客户关系、销售能力、品牌、云基础设施、传统软件和劳动力也有所贡献。贡献性资产收费或明确的有无分析可以减少重复计算。
有无分析将公司与平台的现金流与可信的反事实进行比较。反事实可能涉及购买真实数据、使用竞争供应商、维护特定于客户的模拟器或放弃产品。差异包括加快上市时间、降低数据采集成本、提高模型性能、更好的缺陷覆盖率、降低隐私风险以及接触治理需要证据系统的客户。
预测应该明确地模拟接受度。签署的合同可以包含试点、验证或生产关卡。因此,预期收入取决于技术成功、客户认可、监管配合、实施和更新。概率权重应与可比较群体的证据联系起来。单一混合贴现率无法解释风险进入预测的位置。
该模型应将数量、价格和证据效应分开。数量可以反映客户、数据集、模拟、查询或受监控的部署。价格可能包括平台费、使用费、验证包和专家服务。证据会影响转换、生产时间、更新以及销售相邻模块的能力。分离这些驱动因素可以测试增长是否来自可重复使用的产品经济学,或者来自增加交付团队和定制工作。
最终价值需要特殊的纪律。合成数据方法、隐私技术、计算经济学和监管期望可能会迅速变化。永久增长的假设应该得到持续的资源访问、更新能力、客户保留和资助的研究计划的支持。该模型应包括持续的基准维护、独立保证、安全、领域审查和重新验证。当产品依赖于狭窄的来源群体或快速变化的技术堆栈时,较短的显性经济寿命或较高的再投资率可能是合适的。
说明性管理假设产生 USD 51 million 收入指示。可寻址平台收入预计从第一年的 USD 29 million 到第五年的 USD 53 million。随着证据系统的成熟,接受使用的概率从 70% 上升到 83%。计算、源访问、保证、销售、支持、税收和贡献资产费用后的现金贡献范围从 USD 5.2 million 到 USD 10.6 million。假设明确期限为六年、有限的终端成分和风险调整贴现。这些数字展示了机制,并不是对任何公司的预测。
| 年 | 可寻址收入 | 接受使用概率 | 风险调整收入 | 应占现金捐助 |
|---|---|---|---|---|
| 1 | 29.0 | 70% | 20.3 | 5.2 |
| 2 | 35.0 | 74% | 25.9 | 6.4 |
| 3 | 41.0 | 77% | 31.6 | 7.8 |
| 4 | 47.0 | 80% | 37.6 | 9.2 |
| 5 | 53.0 | 83% | 44.0 | 10.6 |
| 指示 | USD 51.0 million 现值 |
USD 百万(百分比除外);所有数字均为管理层假设,仅用于展示框架。
10 使用市场证据进行严格调整
市场证据可以包括收购、融资轮次、上市公司、软件交易、数据许可和专业服务业务。由于标签综合数据涵盖不同的产品,因此很难进行可比性。计算机视觉模拟公司、隐私保护表格数据平台和临床数字孪生业务具有不同的经济和监管风险。
可比分析应针对收入结构、增长、毛利率、保留率、客户集中度、用例风险、知识产权控制、源数据依赖性、证据成熟度和服务强度进行调整。主要交易价值可能包括人才、战略协同效应或控制权溢价。融资估值可以反映优惠条款和未来选择。公开市场倍数可以包括拥有更广泛产品组合的企业。
买家应该更喜欢操作上的可比性而不是叙述上的相似性。有用的证据包括标准部署时间、总保留时间、净保留时间、经常性毛利率、从试点到接受使用的转换、每位保证员工的收入以及产品更新的频率。增长较低且监管接受度较高的目标可能需要与快速增长的实验工具不同的风险状况。
在说明性案例中,调整后的软件和数据平台证据支持合成数据资产从 USD 35 million 到 USD 60 million 的走廊。该范围仍然很宽,因为已发布的交易很少披露效用、隐私和可重复性证据。该范围用于测试成本和收入指标,而不是替代它们。
| 比较系数 | 更有力的证据 | 证据较弱 | 可能的估值效应 |
|---|---|---|---|
| 客户成果 | 具有可衡量效益的生产用途 | 实验或无薪飞行员 | 更有力的证据支持更高的预期现金 |
| 隐私保证 | 正式保证和独立攻击测试 | 广泛的匿名主张 | 更有力的证据可降低补救和责任风险 |
| 再现性 | 受控重建和完整来源 | 关键人物或无证管道 | 再现性支持可转移性 |
| 监管契合度 | 已定义流程中接受的角色 | 一般监管叙述 | 接受的角色支持转换和更新的可能性 |
| 收入质量 | 标准订阅以及使用和保留 | 定制项目和创始人主导的交付 | 经常性产品经济学支持更高的倍数 |
| 源依赖 | 持久的合法获取和替代方案 | 可撤销的客户数据或单一供应商 | 依赖会降低经济寿命和议价能力 |
拟议的市场证据纪律;交易细节和调整需要独立验证。
11 通过证据加权记分卡协调价值
估值应该协调这些方法,而不是机械地平均。当技术和证据可以重建时,重置成本可以提供信息。当可接受的使用、更新和利润可观察到时,收入证据就会变得更有力。当可比产品和交易条款透明时,市场证据就会变得更有力。
说明性调节从重置成本 USD 24 million、收入值 USD 51 million 以及 USD 35 million 到 USD 60 million 市场走廊开始。加权基于证据成熟度。收入法权重最高,因为目标拥有客户群和使用数据。重置成本限制了存在可靠替代品的结论。市场证据起到了范围检查的作用。
结论针对五种风险进行了调整。对于常见任务,实用性得到了证明,但对于罕见的子组则不太确定。存在隐私测试,而一些旧版本缺乏正式的差异隐私会计。洁净室重建涵盖了核心平台,但不是每个域模块。医疗保健的接受度仍在不断发展。定制服务仍然占收入的重要份额。由此产生的证据加权指示是 USD 43 million。
记分卡应显示新证据如何改变价值。成功的独立隐私审核可以减少折扣。监管机构或主要客户的生产验收可以增加概率加权现金。失去来源、重现性失败或重大事件可能会缩短经济寿命。这种设计使得估值在交割后具有可控性。

USD 百万;仅说明性管理假设。
12 将尽职调查结果转化为交易条款
尽职调查计划应该是可重复的。管理层的演讲可以解释产品;交易决策需要可检查的记录。买方应获取资产清单、来源权、构建清单、评估方法、攻击测试、基准治理、客户接受证据、事件历史记录、收入桥梁和服务成本模型。
Technical diligence should reproduce a representative dataset and selected evaluation results.隐私专家应该挑战威胁模型并测试输出。 Domain experts should examine causal, physical or regulatory constraints.商业尽职调查应就使用、接受、替代和更新等问题与客户进行访谈。 Finance should reconcile contracts, invoices, usage, compute and labour to reported margins.
调查结果应反映出考虑和保护。未解决的源权利可以被排除,在关闭之前进行补救或通过赔偿和托管来支持。不确定的监管接受可以置于与规定的批准或接受的生产用途相关的收益中。关键人员的依赖性可以支持保留安排和文件条件。客户特定项目收入可以获得比标准平台收入更低的倍数。
收益应使用双方都能适当观察和影响的结果。合适的措施可以包括确定的生产验收、从已识别的产品中收集经常性收入、由指定群体更新或完成商定的独立验证。仅基于模型基准的措施可以奖励技术改进,而无需商业认可。仅基于总收入的衡量标准可能会因服务、定价变化或买方的分配决策而扭曲。该协议应定义证据、计算、治理、争议解决和交割后产品变更的处理。
董事会决定应保留索赔登记册。每项重大估价主张均应标明其来源、所有者、证据日期、信心、财务影响和交易反应。例子包括隐私性能、可重复性、来源可转移性、客户接受度和监管状态。该登记册创建了从尽职调查到价格和整合的直接联系。它还使买方能够在证据发生变化时重新审视假设,而不是在几个月后发现标题索赔没有负责任的所有者。
| 寻找 | 结案证据 | 定价反应 | 合同保护 |
|---|---|---|---|
| 隐私保障不完整 | 正式机制代码审查和独立测试 | 折扣或排除受影响的产品现金 | 补救契约托管和特定赔偿 |
| 实用性仅限于某些任务 | 经过验证的任务矩阵和客户验收记录 | 仅体现用例的价值 | 收益与确定的生产采用相关 |
| 域模块不可重现 | 洁净室重建和人工制品库存 | 重置成本或较低的经济寿命 | 交货条件保留和过渡支持 |
| 源访问可撤销 | 同意许可控制权变更和替代来源计划 | 概率权重现金并加上重置成本 | 关闭条件表示和终止保护 |
| ARR 中嵌入的项目服务 | 合同发票使用和劳务调节 | 单独的服务和平台倍数 | 营运资本和收入质量调整 |
| 监管途径不确定 | 书面建议提交历史和权威互动 | 与里程碑相关的阶段性价值 | 具有精确证据定义的或然考虑 |
说明性结构;交易顾问、税务顾问、会计师和技术专家应设计实际条款。
13 管理交割后整合和减值信号
集成应在平台合并之前保留证据。买方应冻结材料代码和数据版本,保留构建清单,保护评估记录并确定客户特定的限制。即使输出看起来相似,迁移也会改变出处、隐私保证和可重复性。
首百日应建立统一的发布登记册。每个合成数据产品都应该有一个所有者、预期用途、源类、生成器版本、隐私设置、实用程序阈值、已知限制、客户权限、批准状态和刷新计划。高风险模块应保持封闭状态,直到其证据在买方环境中重建为止。
价值创造可以遵循三种路线。买方可以标准化保证工作,减少重复项目成本。它可以将经过验证的模块扩展到具有可比用途的相邻客户。它可以结合源访问、域模型和分发,同时保留法律和技术边界。每条路线都应根据收集到的现金和客户成果进行衡量。
整合指标应该区分增长和证据侵蚀。有用的衡量标准包括接受使用收入、试点到生产转换、洁净室重建成功、隐私测试例外、子组效用、发布周期时间、源访问连续性、经常性保证成本、技术劳动力和现金收集后的毛利率。生成的记录或数据集的数量不断增加是一项运营统计数据;如果没有客户认可和经济转化,它就无法创造价值。
损害观察清单应包括源数据权利的丧失、无法复制材料发布、未通过独立隐私测试、客户拒绝、不利的监管反馈、不可或缺的人员的离职、更新恶化以及计算或保证成本的持续增加。每个指标都应该有一个所有者、阈值和响应。早期发现使买方能够在技术问题成为客户或责任事件之前保存证据、缩小索赔范围、纠正控制措施并更新预测。
董事会仪表板应连接技术和商业证据。有用的衡量标准包括接受使用收入、试点转换、总保留率、标准部署时间、每次发布的计算量、隐私测试失败、任务效用、子组错误、可重复构建成功、监管里程碑、事件和未解决的源代码权利。目标应指定阈值失败时的操作。
会计团队应在适用的框架下监控与已确认的无形资产和商誉相关的指标。客户拒绝、监管挫折、重大隐私事件、来源损失、续订下降或更便宜的替代品可能会影响预期现金或经济寿命。交易估值和后续减值有不同的目的,需要专业判断。
结论
综合数据公司可以为 AI 开发、软件测试、模拟、研究和监管创新创建有价值的基础设施。当生成的数据执行定义的客户任务、隐私声明能够抵御攻击、发布可以被复制、限制被记录下来并且客户在重复的工作流程中接受证据时,它们的价值就会出现。
合理的估值首先要分解资产堆栈。它遵循客户决策,一起测试实用性和隐私性,要求出处和受控构建,区分监管路径,重建收入质量并协调重置成本、收入和市场证据。它将不确定性转化为价格、或有对价、托管、赔偿、成交条件和受监管的整合计划。
此方法可以保护交易双方。买家可以避免为定制交付或未经测试的索赔支付软件费用。卖家可以通过记录来源访问、评估、再现性、验收和现金转换来提高准备情况。其结果是估值得到了经受住技术挑战、客户审查和交割后监控的证据的支持。
来源
- 国际财务报告准则基金会。 IAS 38 无形资产。 阅读主要来源
- 国际财务报告准则基金会。 IFRS 3 企业合并。 阅读主要来源
- 国际财务报告准则基金会。 IFRS 13 公允价值计量。 阅读主要来源
- 世界知识产权组织。重视知识产权资产。 阅读主要来源
- 世界知识产权组织。技术转让专业人员的知识产权评估基础知识。 阅读主要来源
- 世界知识产权组织。收入法。 阅读主要来源
- 国际评估标准理事会。观点论文价值和数据。 2024 年。 阅读主要来源
- 国际评估标准理事会。观点论文破译技术。 2023 年。 阅读主要来源
- 国家标准与技术研究所。差异隐私保证评估指南 SP 800-226. 2025. 阅读主要来源
- 国家标准与技术研究所。 SDNist 综合数据报告工具。 阅读主要来源
- 国家标准与技术研究所。差异化私有合成数据。 阅读主要来源
- 国家标准与技术研究所。差异隐私的实用指标没有一种方法适合所有情况。 2021 年。 阅读主要来源
- 英国信息专员办公室。隐私增强技术。 阅读主要来源
- 英国信息专员办公室。 AI 和数据保护指南。 阅读主要来源
- 英国信息专员办公室。 AI中的安全性和数据最小化。 阅读主要来源
- 欧洲联盟。法规 EU 2016/679 一般数据保护法规。 阅读主要来源
- 欧洲数据保护委员会。关于在 AI 模型中处理个人数据的意见 28/2024。 阅读主要来源
- 欧洲联盟。 EU 2024/1689 法规制定了人工智能的统一规则。 阅读主要来源
- 欧盟委员会。欧洲数据联盟战略。 2026 年。 阅读主要来源
- 欧盟委员会。简而言之,数据联盟。 2025 年。 阅读主要来源
- 金融行为监管局。数字沙箱。 阅读主要来源
- 伦敦金融城公司。数字沙盒试点。 阅读主要来源
- 美国食品和药物管理局。医疗设备软件指南导航器。 阅读主要来源
- 美国食品和药物管理局。利用现实世界的证据支持医疗器械的监管决策。 2025 年。 阅读主要来源
- 美国食品和药物管理局。生成 AI 启用的医疗设备的监管注意事项。 2026 年。 阅读主要来源
- 欧洲药品管理局。药品监管网络数据指导小组工作计划 2026-2028. 中的数据和 AI 阅读主要来源
- 美国食品和药物管理局。 IVD 法规概述。 阅读主要来源
- 国家标准与技术研究所。人工智能风险管理框架1.0. 2023. 阅读主要来源
- 国家标准与技术研究所。 AI RMF 手册措施。 阅读主要来源
- 国家标准与技术研究所。 AI RMF 核心。 阅读主要来源
- 国际标准化组织。 ISO IEC 5259-1 用于分析和机器学习的人工智能数据质量。 2024 年。 阅读主要来源
- 国际标准化组织。 ISO IEC 5259-2 数据质量措施。 2024 年。 阅读主要来源
- 国际标准化组织。 ISO IEC 5259-3 数据质量管理要求和指南。 2024 年。 阅读主要来源
- 国际标准化组织。 ISO IEC 5259-4 数据质量流程框架。 2024 年。 阅读主要来源
- 国际标准化组织。 ISO IEC 42001 人工智能管理系统。 阅读主要来源
- 国际标准化组织。 ISO IEC 23894 人工智能风险管理。 阅读主要来源
- 经合组织。隐私增强技术。 阅读主要来源
- 经合组织。人工智能委员会的建议。 阅读主要来源
- 经合组织。经合组织 AI 原则。 阅读主要来源
- 联合国欧洲经济委员会。国家统计组织的综合数据入门指南。 阅读主要来源
- 国家标准与技术研究所。 HLG-MOS 综合数据测试驱动。 阅读主要来源
- 美国人口普查局。避免披露和 2020 年人口普查。 阅读主要来源
- 欧盟网络安全局。数据保护工程。 阅读主要来源
- 国家标准与技术研究所。隐私框架。 阅读主要来源
- 国家标准与技术研究所。网络安全框架 2.0. 2024. 阅读主要来源
- 联邦贸易委员会。人工智能和算法工具。 阅读主要来源
- 欧盟委员会。 AI监管沙箱。 阅读主要来源
- 欧盟委员会。欧洲通用数据空间。 阅读主要来源
- 欧盟委员会。数据法解释。 阅读主要来源
- 世界知识产权组织。技术趋势人工智能。 阅读主要来源

