人工智能2026-08-066198Coding Agent 测评为何要加入失败恢复与改动边界用真实仓库任务评估 Coding Agent 的代码理解、失败复现、修改范围、测试证据和恢复能力,而不只检查生成代码能否运行。Coding Agent模型评估软件测试阅读更多
人工智能2026-08-061067长上下文知识库测评为何要加入冲突与无答案样例通过原子事实、位置扰动、版本冲突、无答案和权限样例评估长上下文问答,而不是把窗口大小当作知识库准确率。长上下文RAG模型评估阅读更多