AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator
Introduced AI Hospital multi-agent framework; models achieve <50% of GPT-4 one-step accuracy; highlights gaps in multi-turn clinical reasoning.
Zhihao Fan, Jialong Tang, Wei Chen et al.