ARTICLE · 1090513
标注在AI专利中的价值分析
标注在AI专利中的价值分析在“算法框架训练为业务模型”的完整链条中,训练前的数据准备环节(数据采集、清洗、增强与标注)是专利挖掘常被忽略的落点。相比模型结构与训练算法,训练数据相关方案往往更贴近具体业务场景,也更容易被认为“不够技术”。本文以发明专利 CN108898225B为例,对标注在AI专利中的价值进行分析。 涉案专利 CN108898225B,发明名称“基于人机协同学习的数据标注方法”,申请号 CN201810416774.0,申请日 2018 年 5 月 4 日,公开号 CN108898225A,原申请人为成都信息工程大学、成都智瑞通拓科技有限公司,已获授权公告(公告号 CN108898225B),专利类型为发明专利,属于人工智能训练数据标注方案。 其独立权利要求 1 限定一种数据标注方法,包括五个步骤:步骤 1,由领域专家制定分类标准和标注规范,并针对每一个类别给出样例作为金标数据;步骤 2,以金标数据作为聚类中心点对数据进行聚类处理,选出与金标数据相似度不低于 90% 的数据作为银标数据以训练标注人员,再用金标数据对标注人员进行测试,测试通过则进入下一步标注,否则继续学习标注规则;步骤 3,以金标数据和银标数据作为训练集,对未分类数据 I 进行分类,置信度不低于 90% 的数据直接采用并加入训练集重新训练分类器以得到模型参数 w,置信度低于 90% 的数据放回待标注数据集;步骤 4,依据主动学习理论,从待标注数据集中选取最值得标注的数据 C(C=argmax P(C|I,w))分发标注,并将标注结果加入训练集重新训练分类器;步骤 5,迭代步骤 3 和 4,当分类器精度达到预设阈值后开始下一分类器的训练。从属权利要求 2 进一步限定:在步骤 3 中从置信度不低于 90% 的数据里抽取部分置信度高于 95% 的数据反向考核标注人员。 说明书将方案的适用对象描述为“机器学习的多分类问题,尤其是垂直领域多层分类问题”,并记载了与权利要求略有出入的实施细节(详见后文)。 该方案直击垂直领域分类任务中“专家标注成本高、众包标注质量参差”的痛点,试图把昂贵的专家知识“扩散”为高质量训练数据,在部分垂直领域实现专家“零参与”。凡是需要以较低成本对海量未标注数据进行高质量分类标注、进而训练分类模型的行业,都可借助其“金标—银标—主动学习”闭环降低成本,例如医疗影像分诊、电商商品类目归类、客服工单分流、工业缺陷分类、内容审核分类等。它属于典型的基础性、平台型方案,商业价值不取决于单一场景,而在于其作为标注流程框架的通用性——这一点也正是其专利保护上的“双刃剑”。 从认知与技术的关系看,标注本质上是把人的经验判断翻译成机器可学习的符号。领域专家制定的“分类标准和标注规范”是凝结行业知识的先验规则;金标数据是规则的具象样本,银标数据是金标在特征空间里“扩散”出的近似样本;主动学习又反过来挑选机器最不确定、因而最有信息量的样本交给人工。整个过程是一场“知识从专家到机器、从小样本到大样本”的接力。这一结构暗含一个专利法层面的关键分野:专利保护的从来不是“数据”或“标签”这些信息本身,而是“让数据承载客观技术关联、并使其适配模型底层运算”的处理手段。换言之,标注方案的技术性不在于标注结果,而在于标注规则的设计与扩散机制是否真正服务于后续模型训练的技术效果——这正是本案客体适格性争议的深层根源。 专利法第二十五条第一款第(二)项排除“智力活动的规则和方法”;专利法第二条第二款要求发明是对产品、方法或其改进提出的“新的技术方案”。依《专利审查指南》(2023)第二部分第九章第 6.1.2 节,一项权利要求若“记载了对要解决的技术问题采用了利用自然规律的技术手段,并且由此获得符合自然规律的技术效果”,才属于技术方案;若处理对象、过程、结果均不与具体应用领域结合,则属于智力活动的规则和方法(参见该节审查示例“建立数学模型的方法”一例)。上述两条均为无效宣告请求的法定理由(《专利法实施细则》第六十九条第二款)。 权利要求 1:步骤 1“由领域专家制定分类标准和标注规范”是典型的人为规则设定,属于思维与表述层面的智力活动,本身不产生技术手段;步骤 2 至步骤 5 中的“聚类处理”,“分类器”,“模型参数 w”“置信度”,“主动学习”等限定,虽借助计算机运算,但权利要求通篇未记载任何具体应用领域,也未限定被处理数据的类型与物理含义——全文使用的是抽象的“数据”,“未分类的数据 I”,而非“医学图像”“语音信号”等具有技术含义的对象。 这与《审查指南》示例中“建立数学模型的方法”高度相似:该示例因“处理对象、过程和结果都不涉及与具体应用领域的结合,属于对抽象数学方法的优化”而被认定为智力活动的规则和方法;与之相对,“对图像进行卷积与池化处理的 CNN 训练方法”因处理对象为图像而构成技术方案。涉案权利要求 1 明显更接近前者。 说明书记载方案面向“机器学习的多分类问题,尤其是垂直领域多层分类问题”,并提及“某些垂直领域”,但同样未将方案落到任何具体技术场景,也未说明“相似度”,“聚类”所依赖的具体特征为何物。客体判断原则上以权利要求所限定的方案为准,说明书的概括性表述难以改变权利要求自身缺乏技术领域限定、被处理数据无技术含义的格局。换言之,说明书无法为权利要求补充“具体应用领域”这一客体要件。 权利要求 1 存在被以专利法第二十五条第一款第(二)项或第二条第二款为由宣告无效的现实风险:一方面,“制定分类标准和标注规范”是智力活动规则;另一方面,聚类、分类器训练等算法特征未与具体技术领域结合,难以满足“技术手段—技术问题—技术效果”三要件。需说明的是,该案于 2018 年申请,在国家知识产权局第 343 号公告(2020 年 2 月 1 日施行)就算法特征申请明确审查基准前后获得授权;若置于现行《专利审查指南》(2023)之下重新审视,其客体风险更为显著。 专利法第二十六条第三款要求说明书对发明作出清楚、完整的说明,以本领域技术人员能够实现为准;第二十六条第四款要求权利要求以说明书为依据,清楚、简要地限定保护范围。公开不充分与不清楚均属无效理由(《专利法实施细则》第六十九条第二款)。 权利要求 1 记载“相似度不低于 90%”;说明书具体实施方式部分却表述为“相似度非常接近的数据通常是指与金标数据相似度不低于 80% 的数据,该指标可以根据各个垂直领域的实际情况进行调整”。权利要求与说明书在关键阈值上不一致,引发两方面问题:其一,权利要求限定的 90% 得不到说明书相应实施例的支持(说明书反而记载 80%),存在“权利要求得不到说明书支持”之虞;其二,阈值被描述为“可根据实际情况调整”,说明其并非由技术原理推导出的确定界限,进一步削弱方案的可再现性。 步骤 2 中“测试通过即可进行下一步的标注”——“测试通过”的判定标准(如正确率、通过样本比例)在说明书中未作任何界定,本领域技术人员无法据此确定何种情形算“通过”;步骤 5 中“分类器的精度达到预设的阈值”同样未给出阈值的确定方式或示例数值。这类模糊限定使方案在“如何实现”上留有空白,构成公开不充分的质疑点。 “聚类处理”未说明采用何种聚类算法及距离度量;“相似度”的计算方式(基于何种特征、何种度量)未披露;“分类器”的类型与结构未限定(仅出现“模型参数 w”,暗示可能是线性模型,但未明示)。这些恰是方案区别于现有技术的核心贡献所在,也是《审查指南》第二部分第九章第 6.3.1 节要求“清楚记载”的部分。核心手段公开不足,是最具实质性的公开不充分风险。 说明书罗列了“减少专家参与度”,“减少标注数量”,“保证标注质量”“缩短开发周期”,“降低成本”等效果,但通篇未见任何对比实验或量化数据。对于依赖算法改进的申请,若技术效果“必须依赖实验结果加以证实才能成立”,缺乏实验数据将构成公开不充分;即便不构成公开不充分,也会削弱说明书的清楚性与说服力。 涉案专利说明书存在阈值矛盾、关键判定标准缺失、核心算法与度量未公开、效果无数据支撑等多处瑕疵,在专利法第二十六条第三款与第四款下均存在被无效的实质风险。相较客体问题,公开充分性问题往往更具体、更易于举证,是无效请求人更可能优先援引的理由。 权利要求 1 是唯一的独立权利要求,采用方法步骤形式,限定五个步骤。依全面覆盖原则(法释〔2009〕21 号第七条),只有被控方法再现权利要求记载的全部技术特征(相同或等同)才构成侵权;缺少一个以上技术特征,或有一个以上技术特征不相同也不等同,即不侵权。这为规避提供了清晰路径。 权利要求明确限定“相似度不低于 90%”。若改用 85%、95% 等其他阈值,即不再落入字面范围。尤为关键的是,说明书在实施例中披露了“不低于 80%”这一未写入权利要求的数值。依捐献原则(法释〔2009〕21 号第五条),“仅在说明书中描述而在权利要求中未记载的技术方案”,权利人不得在侵权诉讼中主张将其纳入保护范围。因此,采用说明书已公开但未主张的 80% 阈值,是成本最低、最可靠的规避手段。 步骤 4 的“依据主动学习理论……选取最值得标注的数据 C”(并给出 C=argmax P(C|I,w) 的具体准则)是必要技术特征。若被控方法采用随机抽样、规则抽样或基于不确定度的其他准则(如熵采样、边缘采样)选取待标注数据,而不采用权利要求限定的 argmax 准则,则不落入步骤 4 的字面范围。主动学习环节算法色彩最浓、最易替换,是理想的规避切点。 步骤 2 以“聚类处理”为手段筛选银标数据。若改用直接相似度检索、阈值过滤或人工筛选等方式得到近似样本,则“聚类处理”这一特征不再成立。 权利要求将“测试通过,否则继续学习标注规则”作为流程分支。若不设置该测试门槛,或采用不同的考核机制,即可避开该特征。 步骤 1 限定“由领域专家制定分类标准和标注规范”。若标注规则由规则引擎、迁移学习或预先训练模型自动生成,而非“领域专家”人工制定,则该特征不成立。 总体而言,权利要求 1 仅有一条独立方法权利要求,由五个步骤共同限定,任意一个步骤的省略或实质替换即可实现规避;加之说明书主动披露了未主张的 80% 阈值,规避成本很低。这本身反映出该案在权利要求布局上的不足:单一方法权利要求、必要的多步骤叠加、无装置/系统/存储介质等平行权利要求,导致保护范围被压缩、规避空间较大。 其一,把“标注规则”写进技术方案,而非停留在规则本身。标注规则设计天然贴近“智力活动的规则和方法”这条红线。撰写时应避免仅描述“制定何种分类标准、标注规范”,而要把规则设计与具体技术场景绑定——明确处理的图像、语音、文本等数据的类型与物理含义,说明规则如何被算法执行、如何影响模型训练的技术效果。创新主体在挖掘时就应追问:这套标注规则解决的是什么技术问题、借助了什么技术手段、带来了什么可度量的技术效果。 其二,建立“数据—训练效果”的技术关联。训练前的数据处理、增强、标注方案要满足客体要求,关键在于让处理后的数据与后续模型训练的技术效果之间建立明确关联。撰写时应在权利要求与说明书中写明:经处理的数据如何使模型更高效地学到数据中的客观技术关联,或如何适配模型底层运算的硬件资源配置,从而提升训练精度或效率。仅有“为了获取训练数据”的处理而无此关联,容易被归入智力活动。 其三,数值阈值与实施方式的披露要自洽。本案“90% 与 80% 并存”的教训提示:权利要求中的数值界限必须与说明书实施例严格对应,避免前后矛盾导致“得不到说明书支持”;同时,说明书若披露了多个备选数值,应意识到未写入权利要求的数值即构成他人的规避空间,必要时通过从属权利要求分层主张。 其四,核心技术手段务必充分公开。聚类算法、相似度度量、分类器结构、判定标准等“体现发明构思”的内容,是《审查指南》要求清楚记载的部分,也是公开不充分审查的重点。撰写时宁可详细记录具体算法、参数与步骤,也不宜以功能性或概括性语言一笔带过;关键效果应附实验数据。 其五,多类型、多层级权利要求布局。本案仅一项独立方法权利要求,保护范围单一、易被规避。企业应将方法权利要求与装置、电子设备、计算机可读存储介质、程序产品等并行布局,并以从宽到窄的从属权利要求形成纵深,防止“单点失效”。对于训练数据相关方案,还可考虑“数据生成方法—训练方法—应用模型”的链条式布局。 其六,授权不等于高枕无忧,建立稳定性自评机制。人工智能算法类专利在客体、公开充分、清楚、创造性等环节均面临较严格的审查与事后挑战。企业应在授权后持续评估专利稳定性,结合现行《专利审查指南》与《人工智能相关发明专利申请指引》对存量专利做“体检”,对高风险专利及早通过布局新申请或技术迭代来补强。 CN108898225B 的个案价值,不在于它是否稳固,而在于它清晰呈现了训练数据相关专利“申请易、稳定难、规避易”的典型症结。对于把专利挖掘延伸到训练前环节的企业而言,真正的功课不在授权那一刻,而在于能否把“贴合场景特征的标注规则”写成有技术根基、有充分公开、有纵深布局的技术方案。这既是对审查与无效程序的提前回应,也是让专利真正成为竞争壁垒的前提。 欢迎咨询:李健律师15889795615。