DRCD: a Chinese Machine Reading Comprehension Dataset
Abstract
A traditional Chinese machine reading comprehension dataset with over 30,000 questions is introduced to serve as a source for transfer learning, with a baseline model achieving near-human F1 performance.
In this paper, we introduce DRCD (Delta Reading Comprehension Dataset), an open domain traditional Chinese machine reading comprehension (MRC) dataset. This dataset aimed to be a standard Chinese machine reading comprehension dataset, which can be a source dataset in transfer learning. The dataset contains 10,014 paragraphs from 2,108 Wikipedia articles and 30,000+ questions generated by annotators. We build a baseline model that achieves an F1 score of 89.59%. F1 score of Human performance is 93.30%.
Models citing this paper 2
steven0226/Qwen3-8B-DRCD-zhTW-QA-GGUF
Datasets citing this paper 1
steven0226/drcd-zhtw-extractive-qa-sft
Spaces citing this paper 0
No Space linking this paper
Collections including this paper 0
No Collection including this paper