Xiaojing Yang - AI Researcher and Machine Learning Engineer

Xiaojing Yang

AI Researcher & Machine Learning Engineer

NLP | Responsible AI | Data-Centric ML | Intelligent Systems

Publications

Published, submitted, and planned research outputs in machine learning, NLP, retrieval, and model evaluation.

PublishedJune 2026

Parameter-Efficient Neural Machine Translation for Low-Resource Language Pairs: English-Norwegian in the Oil & Gas Domain

Xiaojing Yang, Zhihan Li, Gege Sun, Mengyue Li, Meriem Beloucif

Investigates parameter-efficient adaptation of neural machine translation for the Norwegian oil and gas domain, covering LoRA fine-tuning, hyperparameter optimisation, data-quality assessment, and model-scale evaluation.

EAMT

First author; lead experimental contributor

Under ReviewOctober 2026

Beyond Routing: Diagnosing Modular LoRA Experts for Low-Resource Multilingual Petroleum-Domain Translation

Xiaojing Yang, Zhihan Li, Meriem Beloucif

Studies modular expert architectures for low-resource, domain-specific NMT, including language-specific LoRA adapters, learned routing, target-anchored synthetic data, terminology-aware evaluation, and routing analysis.

EMNLP 2026

First author; framework design and experimental lead

Under ReviewOctober 2026

Structure-Aware Graph Retrieval for Evidence Grounding over Long Annual Reports

Xiaojing Yang, Zhihan Li, Meriem Beloucif

Evaluates how document structure, graph-based candidate expansion, and deterministic routing can improve evidence grounding over long financial reports, with robustness testing and held-out-year validation.

EMNLP 2026

First author; retrieval framework and evaluation lead

Projects

Selected research and technical projects in machine learning, NLP, retrieval, evaluation, and applied AI systems.

img
Low-Resource Petroleum-Domain Machine Translation with LoRA

Published EAMT research on parameter-efficient English-Norwegian petroleum-domain NMT, showing how LoRA can adapt NLLB-200 with strong quality gains while updating less than 0.4% of model parameters.

Research
Machine Translation
NLP
Evaluation
img
Diagnosing Modular LoRA Experts for Multilingual Domain Translation

Under-review research on whether learned routing is actually the bottleneck in a modular LoRA expert system for multilingual petroleum-domain translation.

Research
Machine Translation
NLP
Evaluation
img
FinRAG-Equinor: Evidence-Grounded RAG Benchmark

A reliability-audited benchmark candidate for evidence-grounded RAG over 15 Equinor/Statoil annual reports, focusing on traceable report, page, and object-level evidence.

Research
RAG
Information Retrieval
Evaluation

Experience

Research, work, and teaching experience across AI, NLP, data analysis, and machine learning.

Research Projects in Language Technology

Uppsala University / Independent ResearchUppsala, Sweden
2024 - Present

Designed and led research projects across multilingual NLP, machine translation, retrieval, data attribution, and bias evaluation.

PythonPyTorch+9 more

Data Analyst

SAITISITE CHENGDU E-COMMERCE CO., LTDChengdu, China
2020 - 2024

Completed various data analytics projects spanning customer intelligence, sales optimization, and predictive modeling across e-commerce, retail, and marketing domains.

PythonPandas+10 more

Teaching Assistant, Machine Translation

Uppsala UniversityUppsala, Sweden
2026 - 2026

Supported 25 students across assignment marking, lab sessions, and project supervision in a machine translation course.

PythonPyTorch+5 more

Skills

Methods, tools, and technical strengths supporting my research and applied AI work.

4

capability areas across research, engineering, and applied AI

40+

methods, tools, and evaluation practices used in real projects

Evidence

each skill area links back to publications, projects, or experience

AI & Machine Learning

Deep learning, Transformer adaptation, fine-tuning workflows, and model evaluation for research and applied AI systems.

Machine LearningDeep LearningTransformersFine-tuningLoRA / PEFTModel Evaluation

NLP & Language Technology

Multilingual NLP, machine translation, retrieval, and language-technology systems for specialized domains.

Machine TranslationRAGInformation RetrievalLLM EvaluationMultilingual NLPTerminology Analysis

Responsible AI & Evaluation

Bias evaluation, human validation, statistical testing, and model behavior analysis for social and linguistic AI risks.

Bias EvaluationHuman AnnotationBootstrap TestingError AnalysisCohen's KappaVLM Framing

Data-Centric ML

Dataset diagnostics, filtering, attribution, and quality control for understanding how training data shapes model behavior.

Data FilteringData AttributionShapley AnalysisCorpus DiagnosticsQuality ControlData Auditing