每日更新2026-08-20面向中文读者的全球科技与文化资讯编译 · 摘录 · 转述 · 轻解读
环球资讯编译.Global Briefing
深度解读AI全球

85%的公司被AI错误烧了 竞相砍掉可能捕到下一个的人

来源:VentureBeat 2026-08-18 约 14 分钟读完
字号

85%的公司被AI错误烧了 竞相砍掉可能捕到下一个的人。

<p> 已经被AI代理通过Eval而导致生产失败的企业正在加快将人类从部署决定中移除,而不是放慢,即使对自动评价的信任正在全面提高,<a href='https://venturebeat.com/resources/agentic-releasure-and-valuals-equitments- that-got-burned-by-a-bad-eval-eval-en-to-remove-human-to-the-loop-n-the-least' > new VB Pulse Research shows </a>.</p><p><p>7月,在接受调查的108家企业中,有13%表示相信自动评价,<b><a href="https://venturebeat.com/resource/the-agenter-ervalual-gup-organicons-a-a-realization-probal-probelm-proball-pal-ople-ople- 同时,调查答复者以 " b " 为例,将 " /b " 测试与现实世界结果之间的差同为最大的关注点,每月下降10分,从29%降至19%, "/b " 。 </p><p>Yet, <b>49%的调查答复者说,一个AI代理或LLM动力特性清除了公司的测试,随后造成了客户 "/b " 明显的问题,与6月的50%基本不变。 近四分之一(24%)说,这一令人不安的结果已经发生了 "i> more </i> 一次。 </p><p> 最新发现来自 "https://venturebeat.com/resources"。 VentureBeat Intelligence </a> 揭示了企业代理推出的更令人不安的阶段:这一差距不再仅仅在于公司给予代理商多少自主权和他们能在多大程度上核实代理商。 对评价层的信心与该层在防止故障方面日益完善的证据之间日益形成差距。 在经过人工智能测试的企业中,4%的企业完全相信自动检查。 在未发现类似事件的人中,24%的人表示完全信任——六分之一。 有道理:那些体验过试验过剂在活性生产中失败的人,毫不奇怪地更有可能怀疑自动检查过程。 </p><p> 因此,也许有道理的是,致力于解决这一问题的公司——如自动代理误差监测和缓解平台<a href='https://www.raindrop.ai/'>><Raindrop.ai</a>——正在看到市场从几个月前开始剧烈地转变。 </p><p>&quot> ; 我们看到了我们认识的Evals的伟大底线, & quot; 雨滴 CTO Ben Hylak 直接告诉了VentureBeat。 & quot; The Fortune 100 正在日益减少eval集并降低维护的优先次序. 随着系统(MCP,子剂等)的日益复杂,无法充分列举出故障情况. 反之,他们倾向于反常现象,并发布生产前后的检测解决方案。 & quot; </p><h2 > 定向查找,而非市场普查 </h2><p > VentureBeat在代表至少有100名员工的公司中的108人参加了7月的浪潮。 这一数字低于6月的157个答卷人。 在这108起采购案中,69%自称是最终的AI采购当局或建议和影响这些采购的人。 样本向中等规模组织倾斜:63%在100至2 499名雇员的公司工作。 调查结果应按方向阅读。 调查是自选的,而不是一个概率样本,在本作中引用的被烧毁-v.-未被烧伤的分数是41至53个被调查者组别,报告中的其他交叉分数从40至68. </p><p>。 产业组合也发生了变化:技术和软件参与率下降9分,以14%告终,而零售和消费份额又增加了4分,以19%告终。 然而,报告指明了四个月之间值得注意的变化:更多的答复者表示完全有信心,较少点出糟糕的现实世界配比,<b>更多选择整合便利</b>作为决定性的购买因素,以及Braintrust获得初级平台份额。</p><h2>在自动评估中的满意度得到改进,但结果仍然平平平</h2><p>VentureBeat&#x27;s<a href='https://venturebeat.com/orchestration-business-ai-is-entering-an-valuation-gap-agents-are-conde-comfonomy-faster-can-verify-them> June研究查明了一个企业评价差距</a>:公司给予代理人的权力比开发可靠方法测试它们更快。</p><p>7月保存了第一波的关键数字。 在这两个月里,在265个企业的答复中,报告至少有一个测试批准系统使客户失望的比例保持在一个百分点<b>内:6月50%,7月49%。</b></p><p> 这一数字并不意味着49%的代理运行失败,或任何特定评价产品有49%的故障率。 调查询问,在AI功能通过内部测试后,一个组织在前一年是否至少经历了一次针对客户的事件. 部署更多代理人的公司有更多的机会遇到这种事件。 但是,这种限制并没有降低结果的重要性。 内部评价是释放门。 如果大约一半接受调查的组织看到这一大门批准一个后来在客户面前失败的系统,则不能将过关分数视为生产可靠性的证据。 跨塔布强化了这一点. 在41个没有确定测试失败的企业中,有10个完全相信自动化。 以前被烧毁的53所企业中只有两所这样说。 有最小证据表明释放门可能失灵的受访者信心最强。</p><h2> 被烧毁的企业正在加快朝零人部署</h2><p> 反直觉的发现是,在评估失败后公司会做什么。</p><p> 总体来说,<b> 67%要么让代理人推码,要么改变一个系统,而不给人&#x27;在某些低风险情况下获得批准,或者正在修改其管道以支持下一年的做法</b>。 从6月份起,情况没有变化。 7月,37%的人已经允许在有限的情况下这样做,另外30%的人正在建造。 然而,在经测试批准的系统使客户失望的企业中,<b>85%正在采用不批准模式</b>,而小组中报告没有类似事件的占61%。 在今后几年中,只有11%的被烧答复者拒绝端到端部署自动化,而24%的被烧答复者拒绝。 将这一点理解为鲁莽是很容易的,但数据支持另一种合理的解释:部署成熟。 运行更多代理商的组织,在数量上和在相应的工作流程上,都更有可能遇到故障并有自动化部署所需的工程基础设施。 调查无法确定哪种解释占主导地位。 它确实确定,一个客户可见的事件似乎并没有阻止向自治过渡。 有第一手证据证明测试可能漏掉缺陷的答卷人也正在采取最积极的行动,让这些测试批准生产变化。 如果在部署量增加的同时,每次部署的故障率保持不变,即使受影响公司的百分比没有增加,事件总数也会增加。 7月的数据没有测量出出事量,因此这仍然是模式所隐含的风险,而不是测量的结果。 </p><h2> 释放门是自动化的,但生产质量监测仍然滞后</h2><p> 部署前评价和生产监测回答不同的问题。 一项评估询问,一个代理人是否似乎准备装运。 生产监测询问该剂在释放后正在做什么,其活性产出是否仍然正确。 7月样本中的大多数公司仍然强调系统是否发挥作用,而不是答案是否正确。 </p><p>在对这一问题的106个有效答复中,<b>26%使用了内置质量断言</b>——自动法官或护栏检查现场流量,以解决产出质量问题。 另有26%侧重于诸如基础设施跨度、象征性使用以及原始投入和产出等交易痕迹,24%主要跟踪网关度量,如纬度、出错和成本。 追踪和网关数据可以显示断电、减速和中断请求。 它们可能不会标出一个流利、迅速和自信的答案。 报告按照每个架构的实际情况分组,半数的答卷者监测一个代理人是否在运作,而略超过四分之一的答卷者则自动监测其生产产出是否正确。 在已经允许在有限情况下不核准部署的40个答复者中,差距最大。 该组中只有<b>28%自动检查现场回答</b>的含义和正确性。 换句话说,已经将一个人从至少一些释放决定中除名的大多数企业都没有安装自动语义质量监测作为生产后台. </p><p> 这是数据中最明确的业务教训。 部署前测试套件和基础设施的可观察性是必要的,但它们并不涵盖同样的故障模式。 企业需要一种在代理商开始与真正的用户,数据和工具互动后发现不良产出的方法——特别是当没有人首先审查部署决定时。</p><h2>一个独立的代理评价市场开始形成</h2><p> 供应商数据提供了一个更令人鼓舞的迹象:企业正在增加专门的评价工具,专家平台正在逐渐形成。 </p><p>OpenAI&#x27;以 " b"为主平台的原生电价和微量引领,为 " b" 为主平台,为18%; </b"为 " Confident AI&#x27 " ; " DeepEval 为17%; " Brain Trust 为15%</b " 。 </p><p><b > Anthropic&#x27; Claude Console和Workbench为12%, </b>与报告没有专用评价平台的组织建立了联系。 3个选项各占6%:内部制造的工具,即 " Teanfoo " 和 " LangSmith " 。 </p><p> " Brainetrust " x27;主要份额从6月的8%增加到7月的15%,最大的收益来自一个供应商,报告标榜的供应商具有重要的统计意义。 DeepEval从12%升至17%. 没有专用平台的使用率下降了5分到12%,尽管较小的变化本身并不能证实这一趋势。 </p><p> 由于许多公司使用不止一个工具,所以更广泛的足迹更大. OpenAI本土评价出现在31%的堆栈中,DeepEval在27%,Braintust在22%,Anthropic-x27; 本地工具在20%。 自定义内部工具达到14%,而Wights & amp; Biases Weaves和开源的Langfuse则各达到11%. </p><p> 这些是领养数字,而不是产品业绩得分。 调查没有确定一个供应商的代理商比另一个供应商更可靠。 尽管如此,结果还是指出评价会成为一个独特的企业软件层,而不是一个松散的内部脚本集或一个仅在模型提供者XX27;s平台中使用的特性.</p><p> 采购重点随着市场的变化而改变。 <b> 语句 由于决定性因素,选择方便融入的比例上升了12分,达到39分/分,从而导致成本从28%下降到23%。 评价准确度以28%排名第二. 满意度、执行简单和经济价值合计平均数为五分之3.9。 </p><p> 从价格向一体化的转变表明,企业越来越需要一种工具,它们可以安装在现有的发展和监测管道中。 然而,它们的主要成功衡量标准仍然是评价一致性为38%,其次是失败减少和倒退为20%。 购买者正在选择适合情况,同时仍在判断重复性的结果。 </p><p> 切换意图也降温:预计在未来一年里,56%的购买者将增加或更换一个平台,低于6月的64%。 </p><p> 停留比例增加了8分,达到44%。 连同专家的通过,它们表明一些买家正在从评价转向执行。</p><h2>人文审查正在成为对自动漏失</h2><p>的套期。 预算数据显示,企业如何处理更大自主性与不可靠的评价之间的矛盾。 </p><p><b>以人为本的审查工作流程在生产可观察性方面略为领先 </b>,这是最常提到的增加投资的领域,为31%至30%。 </p><p>自动化评价管道占19%,排名第三,其次是16%的安全和政策遵守情况测试。 只有6%的人说其可靠性和评价预算没有增加。 在测试失败的企业中,38%说以人为中心的审查将获得最快的投资增长,相比之下,24%的组织没有被烧毁。 这产生了一个明显的自相矛盾现象:被烧伤的人群最有可能将人们从释放检查站带走,而且最有可能增加用于其他过程中的人的开支。 战略似乎是通过人力支援实现自动化——使代理人员能更快地行动,然后利用审查人员来捕捉自动化评价错过的东西。</p><p> 尚未解决的问题是,这种模式是否达到标准。 代理部署和自动检查可以随着软件量的增长而增加. 审阅时数不以同样的速度下降. 因此,企业可能正在用更大的下游审查功能来取而代之,而不是取消人的监督。 </p><h2> 狭义但因此读作</h2><p> July&#x27;因为数据没有显示企业代理评价在任何地方都失败,也没有证明自动化法官正在恶化。 它显示了更精确的一点:在测得的故障事件改善之前,<b>信心上升了</b>.</p><p>同时,评价周围的基础设施正在成熟。 更多的企业正在采用专门工具,一体化已成为主要的购买标准,已经失败的公司正在增加对人力审查的投资。 市场认识到这一问题,并正在为此花去开支。 但核心可靠性结果依然顽固. 将近半数接受调查的企业仍然报告说,AI特性在让客户失望之前就清除了内部检查。 具有这种经验的答卷人对自动化缺乏信心,在未经人批准的情况下加快部署速度。 报告将这描述为一个不完整的核查模式:通过部署前得分标志着监测的开始,而不是结束。 对大多数企业来说,缩小这一差距的生产质量检查和评价测试仍然在Xx27;t到位。 </p>。

(编译自 VentureBeat;原文 https://venturebeat.com/data/85-of-companies-burned-by-an-ai-mistake-are-racing-to-cut-the-humans-who-might-catch-the-next-one,编译转述,非原文转载)

来源:VentureBeat(原文)
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
相关主题:aistartuptech

评论

登录后可发表评论,评论审核通过后展示。

延伸阅读