Research
AI research agents build experiments, fail the research
AI research agents completed all engineering in a Princeton shadow evaluation but both papers were rejected for lacking research judgment, scoring 2/6 and 1/6.
1 story tagged recursive-self-improvement.