Research AI research agents build experiments, fail the research AI research agents completed all engineering in a Princeton shadow evaluation but both papers were rejected for lacking research judgment, scoring 2/6 and 1/6. Lars Cornelissen · Aug 6, 2026