Research
AI research agents build experiments, fail the research
AI research agents completed all engineering in a Princeton shadow evaluation but both papers were rejected for lacking research judgment, scoring 2/6 and 1/6.
1 story tagged shadow-evaluation.