LLMs Assist NLP Researchers: Critique Paper (Meta-)Reviewing
This study evaluates LLMs (GPT-4, Gemini, Claude) in NLP peer review, revealing high defect rates and limited professional judgment, with scores averaging 7.45 vs. human 6.41.
Jiangshu Du, Yibo Wang, Wenting Zhao et al.