正在筛选:人工智能,共 295 篇清除筛选
长上下文知识库测评为何要加入冲突与无答案样例
人工智能2026-08-061067

长上下文知识库测评为何要加入冲突与无答案样例

通过原子事实、位置扰动、版本冲突、无答案和权限样例评估长上下文问答,而不是把窗口大小当作知识库准确率。

长上下文RAG模型评估
阅读更多
从 Chat Completions 迁移到 Responses 要改哪三层
人工智能2026-08-061093

从 Chat Completions 迁移到 Responses 要改哪三层

按请求、类型化输出和多轮状态三层迁移 OpenAI Responses API,并逐步验证文本、函数调用、结构化输出与流式事件。

OpenAI APIResponses APIAPI 迁移
阅读更多
Coding Agent 测评为何要加入失败恢复与改动边界
人工智能2026-08-066198

Coding Agent 测评为何要加入失败恢复与改动边界

用真实仓库任务评估 Coding Agent 的代码理解、失败复现、修改范围、测试证据和恢复能力,而不只检查生成代码能否运行。

Coding Agent模型评估软件测试
阅读更多
AI 任务合同的五项最小字段
人工智能2026-08-055269

AI 任务合同的五项最小字段

用目标、证据、权限边界、完成条件和停止规则构造最小 AI 任务合同,减少信息不足时的猜测与范围扩张。

提示词工程AI Agent任务设计
阅读更多
模型或提示词升级后如何做回归测试
人工智能2026-08-053123

模型或提示词升级后如何做回归测试

建立覆盖正常、边界和拒绝场景的固定样例集,记录提示词与模型版本,并用自动校验和人工评分判断升级是否可接受。

提示词工程回归测试AI 应用
阅读更多
什么时候该用高推理模型:按失败成本分层选型
人工智能2026-08-059329

什么时候该用高推理模型:按失败成本分层选型

从任务复杂度、结果可验证性、工具副作用和失败影响判断是否需要高推理模型,并用代表性任务完成条件化选型。

模型选型推理模型风险评估
阅读更多