Publications by Tags
- Antibodies 1
- Benchmark 8
- Code Agents 1
- Code Generation 1
- Collaboration 1
- Communication 1
- Competition 1
- Dataset 1
- DNA 1
- Domain Shift 1
- Evaluation 3
- Explainability 1
- Graph Neural Networks 1
- Inference 1
- Model Analysis 1
- Multi-agent 6
- Multilingual 2
- Peptides 1
- Personalization 1
- Planning 1
- RAG 1
- Reasoning 1
- Robustness 1
- Safety 1
- AI for Science 4
- Summarization 8
- Text Matching 1
Antibodies
- » On Pre-training Language Model for Antibody (ICLR 2023)
Benchmark
- » CRAB-Bench: Evaluating LLM Agents under Complex Task Dependencies and Human-aligned User Simulation
- » Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks (ICML 2026)
- » RARE: Retrieval-Aware Robustness Evaluation for Retrieval-Augmented Generation Systems (arXiv 2025)
- » DNALongBench: A Benchmark Suite for Long-Range DNA Prediction Tasks (Nature Communications 2025)
- » On Pre-training Language Model for Antibody (ICLR 2023)
- » MTG: A Benchmark Suite for Multilingual Text Generation (NAACL Findings 2022)
- » CNewSum: A Large-scale Chinese News Summarization Dataset with Human-annotated Adequacy and Deducibility Level (NLPCC 2021)
- » Contrastive Aligned Joint Learning for Multilingual Summarization (ACL Findings 2021)
Code Agents
- » Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks (ICML 2026)
Code Generation
Top ⇈Collaboration
Top ⇈Communication
Top ⇈Competition
Top ⇈Dataset
- » CNewSum: A Large-scale Chinese News Summarization Dataset with Human-annotated Adequacy and Deducibility Level (NLPCC 2021)
DNA
- » DNALongBench: A Benchmark Suite for Long-Range DNA Prediction Tasks (Nature Communications 2025)
Domain Shift
- » Exploring Domain Shift in Extractive Text Summarization (arXiv 2019)
Evaluation
- » Learning Personalized Alignment for Evaluating Open-ended Text Generation (EMNLP 2024)
- » InstructScore: Towards Explainable Text Generation Evaluation with Automatic Feedback (EMNLP 2023)
- » CDEvalSumm: An Empirical Study of Cross-dataset Evaluation for Neural Summarization Systems (EMNLP Findings 2020)
Explainability
- » Global Human-guided Counterfactual Explanations for Molecular Properties via Reinforcement Learning (KDD 2024)
Graph Neural Networks
Top ⇈Inference
Top ⇈Model Analysis
Top ⇈Multi-agent
- » CRAB-Bench: Evaluating LLM Agents under Complex Task Dependencies and Human-aligned User Simulation
- » Learning to Interrupt in Language-based Multi-agent Communication (CoLM 2026)
- » Strategic Planning and Rationalizing on Trees Make LLMs Better Debaters (ICLR 2026)
- » TypedThinker: Typed Thinking Improves Large Language Model Reasoning (ICLR 2025)
- » Cooperative Strategic Planning Enhances Reasoning Capabilities in Large Language Models (arXiv 2024)
- » Learning from Mistakes via Cooperative Study Assistant for Large Language Models (EMNLP 2023)
Multilingual
- » MTG: A Benchmark Suite for Multilingual Text Generation (NAACL Findings 2022)
- » Contrastive Aligned Joint Learning for Multilingual Summarization (ACL Findings 2021)
Peptides
Top ⇈Personalization
Top ⇈Planning
- » Cooperative Strategic Planning Enhances Reasoning Capabilities in Large Language Models (arXiv 2024)
RAG
- » RARE: Retrieval-Aware Robustness Evaluation for Retrieval-Augmented Generation Systems (arXiv 2025)
Reasoning
Top ⇈Robustness
- » RARE: Retrieval-Aware Robustness Evaluation for Retrieval-Augmented Generation Systems (arXiv 2025)
Safety
- » Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks (ICML 2026)
AI for Science
- » DNALongBench: A Benchmark Suite for Long-Range DNA Prediction Tasks (Nature Communications 2025)
- » Global Human-guided Counterfactual Explanations for Molecular Properties via Reinforcement Learning (KDD 2024)
- » On Pre-training Language Model for Antibody (ICLR 2023)
- » Accelerating Antimicrobial Peptide Discovery with Latent Structure (KDD 2023)
Summarization
- » Enhancing Scientific Papers Summarization with Citation Graph (AAAI 2021)
- » CNewSum: A Large-scale Chinese News Summarization Dataset with Human-annotated Adequacy and Deducibility Level (NLPCC 2021)
- » Contrastive Aligned Joint Learning for Multilingual Summarization (ACL Findings 2021)
- » CDEvalSumm: An Empirical Study of Cross-dataset Evaluation for Neural Summarization Systems (EMNLP Findings 2020)
- » Extractive Summarization as Text Matching (ACL 2020)
- » Heterogeneous Graph Neural Networks for Extractive Document Summarization (ACL 2020)
- » Exploring Domain Shift in Extractive Text Summarization (arXiv 2019)
- » Searching for Effective Neural Extractive Summarization: What Works and What's Next (ACL 2019)
Text Matching
- » Extractive Summarization as Text Matching (ACL 2020)