PaperBenchX 评测复现论文任务,10 个模型测试暴露 AI 科研现存卡点

PaperBenchX 科研基准测试完成一轮评测,让 10 个主流大模型完成论文复现任务,在测试过程中发现当前 AI 在科研落地环节存在明显能力