Sri Lanka Document Datasets: A Large-Scale, Multilingual Resource for Law, News, and Policy
本文介绍了一个大规模、多语言的开放数据集集合,包含超过 278,000 份涵盖斯里兰卡法律、新闻和政策的僧罗文、泰米尔文及英文文档,旨在支持计算语言学和社会政治研究。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,斯里兰卡的公共记录——法律、新闻、法院判决和政府报告——就像是一个散落在数百个不同建筑中的巨大且混乱的图书馆。有些书被锁在玻璃柜里(PDF),有些只是写在零散的纸上(网站),而且许多是用三种不同的语言编写的:僧罗文、泰米尔文和英文。对于普通公民、记者或研究人员来说,要在这一片混乱中寻找特定的事实,就像是在一个不断移动的草堆里寻找一根针。
本文介绍了一个名为**“斯里兰卡文档数据集”(Sri Lanka Document Datasets)**的项目,它就像是一个超级组织有序的图书管理员与一辆数字搬运车的结合体。以下是他们所构建的内容:
1. 大规模收藏(“数字仓库”)
该团队收集了 278,621 份文档(约 80.7 GB 的数据),并将其整合进一个整洁、机器可读的封装包中。可以把这想象成建造了一个单一的、巨大的仓库,其中斯里兰卡每一件重要的信息都经过了分类、贴标,并准备好随时被使用。
该收藏包括:
- “法律图书馆”: 议会辩论(Hansards)、最高法院裁决和警察新闻发布。
- “规则手册”: 实际法律(法令)、草案(法案)以及紧急政府公告(宪报)。
- “新闻报摊”: 数以千计的新闻文章和政府更新。
- “天气与经济报告”: 旅游统计、鱼类价格、洪水预警和银行报告。
所有这些内容都以三种语言提供,使其成为一个真正的多语言宝库。
2. 魔法机器(“采集流水线”)
他们是如何获取这些数据的?他们并没有雇佣一个团队来手动复制粘贴文档,而是构建了一个自动化机器人系统。
- 侦察兵: 这个机器人每天都会访问官方政府网站。它很有礼貌;它会检查“禁止进入”标志(robots.txt),并等待轮到自己,以免导致网站崩溃。
- 分类器: 当机器人发现新文档时,它不仅仅是抓取,它还会检查该文档是否已经存在。如果是新的,它会下载、阅读并进行清理。
- 翻译与清理器: 系统将杂乱的 PDF(类似于文本的图片)转化为干净、可搜索的文本。它修复断行,并将数据组织成标准格式(JSON),以便计算机能够轻松理解。
- 每日更新: 这个机器人每天会自动运行多次。如果通过了一项新法律或发布了新的洪水预警,系统会立即捕捉到它并将其添加到收藏中。
3. 公开政策(许可与访问)
通常,大型数据集会被锁在付费墙之后,或者需要特殊权限才能使用。这个项目不同,它更像是一个公共公园,而不是私人俱乐部。
- 免费进入: 任何人都可以免费下载数据。
- 免费修改: 你可以拿走数据,修正错误,或者在其基础上构建自己的工具,只要你注明原始创作者即可。
- 始终可用: 数据被镜像备份在两个流行的平台(GitHub 和 Hugging Face)上,确保即使其中一个网站宕机,图书馆依然开放。
4. 未来计划是什么?
论文概述了未来的三个主要目标:
- 扩充图书馆: 从其他政府部门和历史档案中添加更多类型的文档。
- 精炼语言: 改进系统读取复杂僧罗文和泰米尔文句子的能力,确保“机器人”能完美理解这些语言的细微差别。
- 阅读手写/扫描件: 目前,系统在处理模糊或扫描文档时表现挣扎。他们计划教机器人使用“眼睛”(OCR 技术)从低质量图像中读取文本,将即使是最混乱的老旧纸张也转化为干净的数字文本。
为什么这很重要?
论文认为,通过将碎片化、难以阅读的记录转化为干净、开放且可搜索的数据库,他们正在赋予研究人员、记者和公民一种“超能力”。这使得他们能够追踪法律的变化、监督政府决策,并在不迷失于文书工作中即可研究国家的历史。这关乎于让斯里兰卡的“数字记录”对每个人都触手可及,而不仅仅是那些有时间或有工具去挖掘档案的人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。