均分相近不代表判决一样:Jev 与九家语言模型的 ContractNLI 对照
arXiv:2609.27678 在 ContractNLI 上对照 Jev 与九家托管/本地模型:成本、时延、基线准确率与 All-12 持续正确率会排出不同名次。均分相近可以掩盖翻盘;选型要盯 persistent correctness,而不是只看 accuracy。
7 篇文章
arXiv:2609.27678 在 ContractNLI 上对照 Jev 与九家托管/本地模型:成本、时延、基线准确率与 All-12 持续正确率会排出不同名次。均分相近可以掩盖翻盘;选型要盯 persistent correctness,而不是只看 accuracy。
拆解 alibaba/open-code-review 的混合架构:确定性工程管文件筛选与定位,Agent 管深度推理。对照 AACR-Bench、委托模式与 CI 接入,说明企业可复制点与边界。
拆解 cloudflare/security-audit-skill:Skill 分发形态、六阶段审计、confirmed / needs_validation / rejected 三态结论、对抗式校验与无沙箱时的 fail-open。说明安装用法、企业可抄点与安全边界。
解读 arXiv:2609.26760 Growing Harness:用任务反馈把反复出现的控制决策长成可执行代码,对照「只管塞上下文」与站内 harness / Skills / 确定性流水线叙事,讨论何时该增长程序、何时该留给模型。
从零讲透 Cordis 插件系统、内核、可撤销 effect、反应式 coeffect、时空可组合性,以及它与 DeepSeek Harness、Koishi、Shigma 和 Cordis v4 的真实关系。
教科书里的 ReAct 循环到底缺了什么?我们从 Claude Code 源码中提炼出 Agent Harness 模式——一个可泛化的、让 AI Agent 在生产环境中存活的工程蓝图。
本综合分析审视了自主软件工程中两种主导方法:Ralph Wiggum循环(暴力执行模式)和开放规范(结构化需求框架)。探索这些方法如何解决LLM的"上下文腐烂"和"愚蠢区域"等局限性,以及它们在重塑2026年软件开发的兴起"自主栈"中的作用。