正在筛选:模型评估,共 2清除筛选
Coding Agent 测评为何要加入失败恢复与改动边界
人工智能2026-08-066198

Coding Agent 测评为何要加入失败恢复与改动边界

用真实仓库任务评估 Coding Agent 的代码理解、失败复现、修改范围、测试证据和恢复能力,而不只检查生成代码能否运行。

Coding Agent模型评估软件测试
阅读更多
长上下文知识库测评为何要加入冲突与无答案样例
人工智能2026-08-061067

长上下文知识库测评为何要加入冲突与无答案样例

通过原子事实、位置扰动、版本冲突、无答案和权限样例评估长上下文问答,而不是把窗口大小当作知识库准确率。

长上下文RAG模型评估
阅读更多