NatureEvaluating large language models for accuracy incentivizes hallucinationsAdam Tauman KalaiOfir NachumSantosh S. VempalaEdwin Zhang2026-04-22Full textDOI https://doi.org/10.1038/s41586-026-10549-w