Publications

You can also find my articles on Google Scholar.

Conference papers

SINITICMTERROR: A Machine Translation Dataset with Error Annotations for Sinitic Languages

LREC, 2026

We introduce SINITICMTERROR, a fine-grained dataset with error span, error type, and error severity annotations for machine-translated examples involving Mandarin, Cantonese, Wu Chinese, and Hokkien.

OasisSimp: An Open-source Asian-English Sentence Simplification Dataset

LREC, 2026

OasisSimp is a multilingual sentence-level simplification dataset covering English, Sinhala, Tamil, Pashto, and Thai.

SIB-200: A simple, inclusive, and big evaluation dataset for topic classification in 200+ languages and dialects

EACL, 2024

The dataset builds on the FLORES-200 machine translation corpus and extends sentence-level topic annotations from English to more than 200 languages and dialects.