Research
Shadow evaluation shows AI agents fail open-ended research
Shadow evaluation tests whether AI agents can do open-ended research. They wrote code and ran experiments, but both papers were rejected at 2/6 and 1/6.
1 story tagged open-ended-research.