Development of a System of Indicators for Assessing the Quality of Search Strategies in Systematic Reviews: A Methodological Document Review
本研究开发了一个包含七个维度、共计39个指标的实用系统,用于评估并提高系统评价中检索策略的方法学质量,从而减少偏倚并增强可重复性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在科学研究领域,系统综述是一种强大的工具。想象一下,一群科学家想要了解某个特定医疗手段或社会问题的真相。他们不是进行单次新的实验,而是收集该主题下已完成的所有研究。他们阅读所有文献,检查其质量,并将研究结果结合起来,以创建一个清晰、可靠的答案。这一过程是医学和公共卫生领域决策的金标准,因为它能够穿透单个研究产生的噪音,揭示更宏观的全貌。然而,整个过程都建立在一个单一且脆弱的基础之上:检索策略。这是研究人员用来寻找这些研究的具体指令集。如果检索范围过窄,他们会遗漏重要的证据;如果检索过程过于混乱或编写拙劣,他们可能会找到无关的垃圾信息,或者根本找不到正确的论文。当检索失败时,系统综效综述的最终结论就会出现偏差,可能导致医生和政策制定者基于不完整或有偏见的信息做出决策。
尽管这一步骤至关重要,但这些检索策略的质量却经常被忽视。研究人员早已知道需要做到彻底,但一直没有标准化的方法来衡量一次检索是否真正做得出色。来自德黑兰大学的 Alireza Jahani 和 Keyvan Salehi 的一项新研究旨在解决这一差距。研究人员致力于构建一个实用的指标体系——一个由具体、可衡量的迹象组成的清单——供任何人使用,以评判系统综述中检索策略的质量。他们的目标是超越模糊的建议,提供一个具体的框架,让研究人员、评审员和期刊编辑可以使用该框架,以确保这些研究建立在坚实的基础之上。
为了创建这个系统,作者进行了两阶段的研究。首先,他们对现有知识进行了深入挖掘。他们收集并阅读了三十五份不同的文件,包括书籍、国际指南以及讨论如何编写和评估检索策略的既往研究。从这庞大的文本集合中,他们提取了关于何为优质检索的 128 个初步概念。随后,他们仔细组织这些想法,合并含义相同的内容,并删除重复项。通过这一精炼过程,他们将 128 个想法浓缩为最终的 39 个具体指标,并将其归纳为七个主要类别。这些类别涵盖了检索的整个生命周期,从最初的规划到最终的报告。
第一个类别,作者称之为“选择全面性”(Selection Comprehensiveness),侧重于检索发生的场所。研究发现,高质量的检索必须在许多不同的地方进行,包括主要的专业数据库和多学科集合。研究人员明确指出,仅依赖单一的通用搜索引擎是不够的。他们发现,仅使用一种来源,或过度依赖通用网络搜索,会增加遗漏重要研究的风险,并引入偏见。一个好的检索策略必须足够广泛,以便从多样化的科学来源中捕捉相关证据,同时避免仅仅使用一个简单易用的工具作为唯一的真理来源。
第二个类别涉及“检索策略结构设计”(Search Strategy Structure Design)。这关乎检索背后的逻辑。研究强调,强大的检索始于一个清晰、定义明确的问题,通常围绕特定的元素展开,例如正在研究的人群和正在测量的结果。研究人员发现,有效的策略会将核心概念组合在一起,并寻找表达这些概念的所有可能方式,包括使用技术性的医学术语和日常用语。他们还强调,这个过程应该是迭代的,这意味着研究人员应该测试他们的检索,观察返回的结果,然后根据所获信息来优化问题和术语。这种测试与改进的循环可以防止检索过于狭隘或遗漏使用不同措辞描述同一概念的研究。
第三个类别,“句法构建”(Syntactic Formulation),涉及检索的技术规则。正如句子必须遵循语法规则才能使人理解一样,计算机检索也必须遵循特定的句法规则才能正常工作。研究指出,每个数据库都有自己独特的规则,用于规定如何组合词汇、如何使用代表“与”(and)或“或”(or)的符号以及如何处理特殊字符。研究人员发现,这些技术细节方面的错误很常见,会导致检索遗漏相关文档,或者返回数千条无关信息。为了避免这种情况,高质量的检索会使用正确的符号,并经常利用工具将检索式从一个数据库翻译到另一个数据库,以确保逻辑在不同平台间保持一致。
除了主要的检索之外,第四个类别“补充检索”(Supplementary Searching)旨在寻找那些可能隐藏在阴影中的证据。研究指出,许多重要的发现,特别是那些没有显示出显著效应的研究,从未在标准期刊上发表。为了找到这些内容,高质量的综述必须走得比单纯搜索数据库更远。它应该包括查阅已发现文章的参考文献列表、查看会议论文、搜索未发表的临床试验,甚至联系该领域的专家。作者认为,跳过这些额外步骤会使综述容易受到“发表偏倚”的影响,即最终结果仅反映了那些幸运地得以发表的研究,而非证据的全貌。
第五个类别是“验证”(Validation)。这一步是在工作完成前进行检查。研究发现,最佳实践是聘请一名信息专家(即受过寻找信息专业训练的人员)来审查检索策略。这位专家可以发现原始研究人员可能忽略的错误。此外,检索应针对一份已知的核心文章列表进行测试,以查看其是否成功找到了这些文章。如果检索未能找到这些已知的关键研究,则说明其灵敏度不足,需要进行调整。这一验证过程起到了安全网的作用,确保检索能够获取综述所需的关键证据。
第六个类别“报告透明度”(Reporting Transparency),侧重于如何记录检索过程。研究强调,为了使综述具有可信度,作者必须详细记录其做法。这包括列出使用的每一个数据库、执行检索的具体日期以及完整的检索词列表。他们还必须解释为何纳入或排除某些研究,以及如何剔除重复的结果。如果没有这种细致程度,其他科学家就无法重复该检索以验证结果。研究人员发现,遵循既定的报告清单有助于确保没有遗漏任何关键步骤,并使整个过程对读者而言是清晰透明的。
最后,第七个类别“过程更新”(Process Updating),确保综述在发布前保持时效性。由于新的研究每天都在发表,一个在一年前完美的检索,在综述发布时可能已经过时。研究建议在出版前不久再次运行检索,以捕捉任何新证据。它还建议,研究的选择过程应由至少两名研究人员独立进行,以减少个人误差,并且团队应使用软件来管理发现的大量文献。
在开发出这套包含 39 个指标的系统后,研究人员对其进行了测试。他们将这个新开发的清单应用于已在科学期刊上发表的二十篇系统综述。他们评估了每篇综述是否符合他们所确定的指标。结果显示,虽然有些综述表现出色,但许多综述存在明显的缺陷,特别是在句法技术和由专家验证检索这一关键步骤方面。作者得出结论,他们的新系统提供了一个实用且必要的工具,用于提高系统综述的质量。通过使用这些指标,研究人员可以减少偏见,提高研究的可重复性,并确保他们收集到的证据真实反映了现实世界。该研究建议,期刊应要求作者将此系统作为系统综述过程的标准组成部分,从而确保这些关键科学总结的基础与其得出的结论一样坚实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。