Research Shadow evaluation shows AI agents fail open-ended research Shadow evaluation tests whether AI agents can do open-ended research. They wrote code and ran experiments, but both papers were rejected at 2/6 and 1/6. Lars Cornelissen · Aug 18, 2026