Research
AI research agents build experiments, fail the research
AI research agents completed all engineering in a Princeton shadow evaluation but both papers were rejected for lacking research judgment, scoring 2/6 and 1/6.
2 stories tagged ai research.
AI research agents completed all engineering in a Princeton shadow evaluation but both papers were rejected for lacking research judgment, scoring 2/6 and 1/6.
Anthropic's J-space exposes hidden words shaping LLM reasoning. Mechanistic interpretability advances, but misuse detection stays unproven.