GENIA项目-GENIA语料库

简介:

GENIA corpus

The GENIA corpus is the primary collection of biomedical literature compiled and annotated within the scope of the GENIA project. The corpus was created to support the development and evaluation of information extraction and text mining systems for the domain of molecular biology.

GENIA语料库是为GENIA项目编写并标注的最初的生物医学文献集合。这个语料库是为了发展和评估分子生物学信息检索及文本挖掘系统而创建的。

The corpus contains 1,999 Medline abstracts, selected using a PubMed query for the three MeSH terms "human", "blood cells", and "transcription factors". The corpus has been annotated with various levels of linguistic and semantic information.

PubMed 是一个免费的搜寻引擎,提供生物医学方面的论文搜寻以及摘要。它的数据库来源为MEDLINE。其核心主题为医学,但亦包括其他与医学相关的领域,像是护理学或者其他健康学科。它同时也提供对于相关生物医学资讯上相当全面的支援,像是生化学与细胞生物学。该搜寻引擎是由美国国立医学图书馆提供,作为 Entrez 资讯检索系统的一部分。PubMed 的资讯并不包括期刊论文的全文,但可能提供指向全文提供者(付费或免费)的连结。

这个语料库包含1999条Medline的摘要,这些摘要是由PubMed按照human、blood cells以及transcription factors三个医学主题词(medical subject heading terms )为搜索条件搜索到的。这个语料库已经被按照不同级别的语言信息、语义信息进行标注。

  • 词性标注
  • 句法标注
  • 术语标注
  • 事件标注
  • 关系表述
  • 共指标注
  •  

    Part-of-speech (POS) tagging is an initial step of natural language processing which is often performed right after or together with tokenization. After tokenization, every token is assigned a POS label. The GENIA POS annotation generally follows the Penn Treebank POS tagging scheme. The following modifications of this scheme were introduced for the GENIA part-of-speech annotation:

    POS标注是自然语言处理的初始步骤,通常在分词之后或与分词同时进行。分词之后,每个词都被分配一个POS标签。GENIA POS标注大体上遵循滨州树库POS标签体系。为了使这个体系适用于GENIA,做了以下修改。,

    • The NNP and NNPS (proper name) tag is used only for the names of journals, authors, research institutes, and initials of patients. Especially, (discoverers') names in technical terms (e.g. Epstein-Barr virus, Southern blotting) are not tagged with NNP tags.
    • NNP和NNPS(专有名词)标签仅用于期刊、作者、研究机构以及患者(?)首写字母。特别需要注意的是,专业术语中的名字不会被标记上NNP标签。
    • We tried to eliminate SYM tags as much as possible.
    • 我们尽可能的淘汰掉了SYM标签。

    See the annotation guideline for the detail. The abstracts are first tagged by the JunK tagger and then corrected by human annotators.

    可以从标注指南中看出更多细节。这些摘要先由JunK标记,然后由标注人员进行更正。

    Examples

     

    Corpus format

    语料库格式

    The corpus is available in two formats, both included in the package available for download below.

    这个语料库可以有以下两种格式,都包括在下边供下载的包中。

    • PTB-like format: The file contains one token/POS pair per line, and a "==========" line (ten equal signs) is put between sentences.
    • PTB-like格式:这个文件中每一行都有一对token/POS,以及每两句中间都有一个“==========”(10个等号)
    • "Merged" gpml format: The POS information is merged into GENIA corpus ver 3.02 using tag which surrounds the token, where the POS is represented as the value of "c" attribute.
    • “Merged” gpml 格式:POS信息被合并到GENIA语料库3.02版(用标签将分词括起来),POS被表示为C属性。

    In the merged format, but not in the PTB-like format, there are some tokens which are assigned "*" as POS. This occurs when a token is split by tags assigned by the annotators of original GENIA corpus. In such cases, the last fragment of a split token is assigned the original POS tag assigned by POS annotators, and other fragments are assigned "*", e.g. anti-IgM.

    在合并格式,并非PTB-like格式中,当一个分词被由原始GENIA语料库标注器给出的标签分割,它的POS就是“*”。这种情况下,一个分词的最后一段被POS标注器分配一个初始POS标签,而其他片段被标注为”*”。例如:anti-IgM.

    Documentation

    文献

    Annotation guidelines

    标注准则

    • Tateisi, Yuka and Jun'ichi Tsujii. GENIA Annotation Guidelines for Tokenization and POS tagging. Technical Report (TR-NLP-UT-2006-4). Tsujii Laboratory, University of Tokyo, 2006.

    Publications

    出版物

    Download

    下载

    Acknowledgments

    Yuka Tateisi: GENIA part-of-speech corpus annotation coordinator


    本文转自ZH奶酪博客园博客,原文链接:http://www.cnblogs.com/CheeseZH/archive/2012/10/28/2743209.html,如需转载请自行联系原作者

    相关文章
    |
    机器学习/深度学习 自然语言处理 达摩院
    Rethinking Information Extraction :信息抽取的现状与未来
    ​ ##引言 从计算到感知再到认知是业内学者都认同的人工智能技术发展路径。机器具备认知智能,进而实现推理、规划乃至联想和创作,在一定程度上需要一个充满知识的大脑,而信息抽取是获取知识的重要途径之一。 在具体的业务场景如搜索推荐,结构化的领域知识有利于实现细粒度文本理解,有利于实现精准的复杂问答,有利于
    6654 0
    |
    移动开发 资源调度 前端开发
    尝试Capacitor(Vue+Android)混合开发
    尝试Capacitor(Vue+Android)混合开发
    2781 0
    尝试Capacitor(Vue+Android)混合开发
    |
    存储 Java Maven
    如何使用Spring Boot和MinIO实现文件上传、读取、下载和删除的功能?
    如何使用Spring Boot和MinIO实现文件上传、读取、下载和删除的功能?
    3179 5
    |
    11月前
    |
    机器学习/深度学习 自动驾驶 算法
    提升回归模型可信度:4种神经网络不确定性估计方法对比与代码实现
    回归任务中,模型常只输出预测值而忽略不确定性,带来潜在风险。本文对比四种神经网络不确定性估计方法:均值+对数标准差、均值+对数方差、MC Dropout与简化PPO。实验表明,前两者在混凝土强度数据上表现最佳,能有效识别可靠预测,而PPO效果不佳。准确评估不确定性对医疗、自动驾驶等高风险领域至关重要。
    817 1
    提升回归模型可信度:4种神经网络不确定性估计方法对比与代码实现
    |
    6月前
    |
    人工智能 安全 测试技术
    GitHub变了:私有仓库也要“喂AI”?开发者该怎么应对
    GitHub新规将自2026年4月起,默认用用户代码及开发行为数据训练AI,覆盖私有仓库。开发者控制权削弱、数据边界模糊引发担忧。个人开发者需立即关闭训练授权,并对代码分级管理。这标志着:代码正从资产变为AI训练燃料。
    |
    7月前
    |
    人工智能 开发者
    零部署OpenClaw接入飞书实现热门新闻主动推送功能
    OpenClaw是可部署于本地或云环境的开源AI智能体,支持飞书等平台接入。本案例指导在华为开发者空间零部署启动OpenClaw,快速接入飞书,实现热门新闻主动推送,打造专属“数字管家”。
    |
    11月前
    |
    存储 机器学习/深度学习 人工智能
    基于反馈循环的自我进化AI智能体:原理、架构与代码实现
    自我进化智能体突破传统AI静态局限,通过“执行-反馈-调整”闭环,实现持续自主优化。它结合大模型与在线学习,利用多评分器反馈自动改进提示或参数,无需人工干预。适用于医疗、金融、编程等动态场景,推动AI迈向终身学习。
    1656 12
    基于反馈循环的自我进化AI智能体:原理、架构与代码实现
    |
    数据采集 人工智能 自然语言处理
    52_领域模型:BioBERT与FinBERT
    在大语言模型(LLM)快速发展的今天,通用模型如GPT-4、Claude 3和Gemini虽然在广泛任务上表现出色,但在专业领域如医疗、金融和法律等场景中,往往难以达到专业人员的期待精度。2025年的研究表明,领域特定的预训练模型在垂直领域任务中能够显著超越通用模型,为专业应用提供更可靠的支持。本文将深入剖析BioBERT、FinBERT等代表性领域模型的技术原理、训练方法、性能评估及实际应用案例,探讨垂直领域预训练的独特优势与未来发展趋势。
    1503 0
    |
    机器学习/深度学习 JSON 并行计算
    10分钟微调,让0.6B模型媲美235B模型!免费体验进行中
    本方案介绍如何通过模型蒸馏技术,利用大参数模型生成数据并微调小参数模型(如 Qwen3-0.6B),使其在特定任务(如从一句话中提取结构化信息)中达到接近大模型的效果。通过 GPU 云服务器进行高效微调,结合魔搭社区的 ms-swift 框架,用户可快速完成模型训练与部署,显著提升推理速度并降低成本。方案包含详细步骤:数据准备、模型微调、效果验证及部署建议,并提供免费试用资源,助力开发者快速上手实践。
    10分钟微调,让0.6B模型媲美235B模型!免费体验进行中
    |
    Linux Docker Windows
    Docker Compose
    Docker Compose
    1992 29

    热门文章

    最新文章