通俗易懂地讲解电子取证(eDiscovery)领域的分析
在数字世界中取得成功并不断进步所需的关键要素
作者:史蒂文·图尔 / 2014年 / Content Analyst市场营销副总裁
在《eDiscovery Journal》上最近发表的一篇博客文章中,格雷格·巴克尔斯指出,目前提供适用于早期案件评估(ECA)和审查平台分析技术的公司寥寥无几,且各平台之间的具体分析功能可能存在显著差异。 尽管对于深入从事电子取证分析领域的人士而言,这可能并非新鲜事,但该文章仍揭示出,市场在电子取证流程初期阶段如何运用分析技术方面存在一定程度的模糊性。 此外,文章还探讨了分析技术如何融入电子取证工作流程,以及分析技术最终能为电子取证乃至整体信息管理带来多少投资回报率(ROI)。
本概述旨在进一步破除围绕电子取证(eDiscovery)和信息治理领域分析所产生的种种误解,并就这些分析能为善用这些机遇的人带来何种回报提供一种视角。 如今,那些像这样制定面向未来的战略、未雨绸缪的企业法务人员,将成为电子取证分析的真正英雄和受益者,并在各自领域发挥先锋作用,以更加积极主动且经济高效的方式应对信息管理和法律技术方面的挑战。
数据分析领域争夺市场份额的竞争
尽管电子取证领域已取得诸多里程碑式进展,但律师事务所和服务提供商正将目光投向“西方”——一片尚未开发的领域。 这场“千兆字节淘金热”的核心在于,在更早的阶段对数据进行分析,以便在诉讼中需要这些数据之前就将其“掌握”在手。 ECA是律师事务所和服务提供商最初进军的领域,其目标是进一步向上游拓展,但更肥沃的沃土还位于更上游——即一些人所谓的“预发现”领域。 电子取证领域的黄金法则很简单:谁“掌控”了内容,谁就掌握了黄金。 换言之:能够尽早实施分析——甚至在诉讼程序中尚无此需求之前——的服务商,将为企业提供最大的附加值,从而获得巨大的竞争优势。
成功的秘诀
这一切听起来都很棒,但在实践中这意味着什么呢?如果不了解所需的原料、它们的作用机制以及如何影响最终结果,就无法制作出一块蛋糕。 鉴于每套电子取证(eDiscovery)解决方案都具备不同的分析功能,本文将简要介绍电子取证和信息治理分析的主要组成部分。
动态分组——这是一个很好的起点,特别是当你对内容了解甚少或一无所知时。在分组过程中,内容(文档、电子邮件等)会被“划分为”概念上相关材料的自然分组。 基于聚类的分组的一个关键优势在于,它能够以极其客观、一致且以概念为导向的方式,快速概览整组文档。 这使审校人员能够直接访问对其最感兴趣(概念上相关)的聚类,从而避免在没有概念相关性的聚类上浪费时间。 在信息管理方面,它还能帮助快速、简便地识别并清除 ROT 内容(冗余、过时和临时内容),从而降低成本并提高投资回报率。
术语扩展——您有一个关键词、名称、技术术语、缩写或首字母缩略词,并希望获取所有相似或密切相关的术语列表,以便将检索范围扩展至包含这些术语的文档。 术语扩展功能会识别出概念上相关的术语,这些术语会根据您的内容进行调整,并按相关性排序。 例如,搜索“巴拉克·奥巴马”可能会生成包含“奥巴马总统”、“三军总司令”、“奥巴马参议员”、“米歇尔·奥巴马”、“椭圆形办公室”、“总统办公室”、“POTUS”等术语的列表。 实际上,这意味着可以更快、更轻松地找到概念上相关的内容,从而节省时间和金钱。 在信息治理领域,这有助于识别与企业文件、知识产权和合规性相关的内容,当然,还能为具有法律依据的删除操作提供更多ROT(已过期、冗余或无用)内容。
概念性检索——您已找到一份重要文档或一段关键内容,现在希望查找类似的文档。 在关键词搜索中,您可以检索到包含特定关键词的文档——前提是您尽可能优化布尔搜索式,且这些关键词确实出现在检索结果中。 然而,编写布尔搜索语句可能耗时较长,即便如此,仍可能遗漏那些包含您搜索语句中未涉及的“未知”术语的重要文档。 若要找到那些在关键词搜索中原本会被忽略的文档,您应使用概念搜索。 概念搜索将数学算法应用于您的示例文档或选定文本,并在数据“地图”(即所谓的概念空间)中寻找相应的模式。其优势在于,即使对应文档中不包含示例文本中的任何术语,概念搜索仍能找到相似的结果。 请考虑缩写、拼写错误、首字母缩略词、代码词以及您尚未了解的相关术语。随后,通过同义词和多义词过滤掉不正确的结果。结果是:您将发现高度相关但隐藏的关系,从而节省时间和成本。
自动分类——预测性编码(Predictive Coding)是过去两年间在电子证据披露(eDiscovery)领域备受关注的领域。 自动分类是预测性编码的基础。在预测性编码中,通过将机器学习技术应用于一组文档,可以以多种方式智能地对文档进行分类,例如将其划分为机密、相关或不相关等类别。 通过这种方式,用户可以在第一阶段将文件分类为相关文件,随后将相关文件进一步细分为相关的主题子类别。自动分类利用相同的概念空间和相同的参考文件,来识别概念上相似的文件并据此进行标记。 同样,其主要优势在于能大幅节省时间(和成本),因为该技术能够以最快、最简单的方式筛选出最相关的文档,并将其提供给相关领域的专家。
邮件链——邮件链的概念相对简单:即识别位于对话链中每条分支末端的邮件子集。 与其来回阅读30封邮件——还要浏览对话中被转发的分支—— 电子邮件“线程化”功能会识别出包含所有先前回复的邮件子集(即所谓的“包含性”邮件,例如这六封邮件就涵盖了整个历史记录)。 使用电子邮件“线程”功能所节省的时间和成本显而易见, 但同样重要的是,需意识到“线程”功能能精确揭示谁在何时知晓了什么——这对还原某项议题的事件发展脉络至关重要。
近重复文档检测——近重复文档检测与电子邮件聚类具有相似的优势。尽管可以通过概念搜索、聚类或分类来识别与案件相关的文档,但其中许多可能是同一文档的不同版本。 一旦确认这些是近似重复文件,便无需耗时地逐一核查每份文件。当需要了解不同版本之间的具体变更内容、变更时间及变更人员时,差异高亮功能可清晰标示这些修改,从而节省时间并降低成本。 在案件处理初期就对准重复文档进行聚合,还能为审阅人员提供一套更清晰的文档集合。
将您的数据纳入饮食计划
如果使用这些分析功能,您可以显著减少数据量。在电子取证(eDiscovery)领域,这意味着费用高昂的专家需要分析的文件数量将减少。这也意味着,他们所分析的文件将仅限于那些在概念上与案件最相关的文件。 此外,提交给审计人员的文件并非随机选取,这使得审计工作更具针对性,将准确性提升至前所未有的水平,并进一步降低了成本和所需时间。
不过等等……这还没完呢!
还记得上文提到的“千兆字节淘金热”吗?还有“数据黄金法则”呢? 正是在这一点上,分析才是揭示企业数据中所有隐藏信息的关键——这远在电子取证(eDiscovery)需要这些信息之前。 在初步调查阶段,对企业的电子文档主动应用文本分析,意味着一旦出现案件,相关数据已经过整理、精简,并准备就绪,随时可供呈示。 企业法律顾问非常青睐这一理念,因为它能将诉讼成本控制在最低水平,缩短调查或达成和解所需的关键时间,并帮助他们以最佳方式阐述自身立场。
结论:电子取证分析中的投资回报率(ROI)
关于在电子取证(eDiscovery)中运用分析技术来确定投资回报率(ROI),可概括如下:文件分析是电子取证中最大的成本因素。专业专家的费用不菲——他们的专业知识在诉讼过程中无疑具有极高的价值。 然而,如果他们的大部分时间都花在分析与诉讼无关的文件上,那就未能充分发挥其潜力。 无论是在分析对诉讼至关重要的文件,还是分析与诉讼完全无关的文件,专家的工作时间成本都是一样的。就像在看手相时不会戴手套——手套只会妨碍占卜师的工作。 同样,如果不先利用机器学习,就将一堆文件提交给高昂的审阅人员,也是没有意义的。此外,识别出那些若未经分析就会被忽略的文件,也可能影响专家制定案件策略的能力。
然而,在证据开示程序开始前对文件和电子邮件进行分析所带来的投资回报率(ROI)远不止于此。 对内容进行主动整理和分析所带来的成本优势是巨大的,这有助于推动决策流程,并促进信息管理程序在合规、降低风险和成本控制方面的实施。 及时实施这些策略可在长期内带来巨大优势,因为这使得信息管理和电子证据披露(eDiscovery)能够采取一种更加主动且经济高效的处理方式。
订阅我们的新闻通讯
感谢您的订阅。
