cloudflare-harness
Agent harnesses
harness 的定义那一句与它列出的职责;这一页其余章节与整套 Agents 文档没有读
对 harness 的定义:让智能体表现得像智能体、而不是一次模型调用的那个循环。
打开原始来源一题一页 · 运行机制 · 也叫 harness、agent loop
让 AI「一直干下去」的那个循环程序:拼好要给模型看的内容、调用模型、执行模型要的工具、把结果送回去、决定继续还是停。
此刻在看:静态解释,这一页的 5 个部分都是这一种。
主张依据 2 类:官方文档、编辑解释。
核实状态:这一页没有需要核实的结论,所以这一维是空的。
表示此刻展示方式,不是准确性等级。
可多选,每种都有实际引用;「本站实验」需有记录。
附范围、时间及必要原因,不等于全页绝对正确。
这一页没有需要核实的结论,所以这一维是空的——不会因为它挂着论文就替它标一个「已核对」。
你让 AI「查一下明天天气再帮我改行程」。模型写出「我要调用天气工具」,是 harness 真的去调用,再把查到的结果放回去给模型看,模型才能接着改行程。
大家谈 AI 的时候,注意力都在模型上:哪家的模型更聪明,参数多大。但一个能替你做事的 AI,模型只是一半。另一半是一个不起眼的程序,它决定模型看到什么、能用什么、什么时候停。这个程序就是 harness。
模型像一个只能通过纸条交流的专家。它读你递进去的纸条,写一张纸条递出来。它写「请帮我查一下天气」,自己是查不了的。harness 就是那个来回传纸条、并且真的去查天气的人。专家再聪明,没有传纸条的人,什么都做不成。
因为模型之间的差距在缩小,而「传纸条的人」做得好不好,开始决定一个 AI 产品好不好用。同一个模型,配上不同的 harness,一个能把任务做完,一个做到一半就迷路。
软件测试里也有一个词叫 test harness,意思是「运行测试用的脚手架」。它和这里说的 agent harness 只是同名,不是一回事。
cloudflare-harness
harness 的定义那一句与它列出的职责;这一页其余章节与整套 Agents 文档没有读
对 harness 的定义:让智能体表现得像智能体、而不是一次模型调用的那个循环。
打开原始来源