您当前所在位置:首页-公司新闻-《不开玩笑,科大讯飞的机器人要参见高考了》
"哑巴模型"Jev火了,会给AI产业带来什么改变?
2026-09-30作者:AutoLab来源:品途商业评论
Jev模型的热度已持续超过一周,从创意玩法到基础逻辑,相关探讨仍在不断深化。
Jev不参与对话,也不协助撰写文章或代码,其功能单一:当开发者提供一组选项和当前状态时,它仅输出判断结果。
Jev的创造者Diogo Almeida曾任职OpenAI研究员,参与过InstructGPT、ChatGPT及GPT-4的相关研发。他原本教导大型模型学会对话,如今却反其道而行,构建了一个拒绝交流的模型。
Almeida为何转变方向?Jev触及了当前大型模型行业的哪些忧虑?将能力收缩至极致,是否会成为模型行业未来的走向?
某些任务无需动用最强模型
Jev的流行,首先回应了Agent时代最现实的问题:模型调用需要更快、更便宜。
开源项目Browser Use的创始人利用Jev搭建了一个浏览器Agent,在真实的Google Flights页面上查询从苏黎世到伦敦的机票。整段流程耗时7.1秒,单次成本为0.0039美元,Jev在循环中的中位延迟约为178毫秒。
Jev的价格也极具竞争力。目前,Vercel AI Gateway上Jev的输入价格约为每百万token 0.04美元,输出免费,因此开发者可以无负担地调用。
缓慢和昂贵成为行业的共同焦虑,这与Agent正从代码场景扩展到更广泛的办公场景有关。
OpenAI数据显示,从今年2月到6月,企业每周活跃Codex用户数在法律、销售与招聘以及市场营销领域分别增长至原来的108倍、41倍和26倍。
当模型成为持续执行任务的基础设施,调用频率和Token消耗也随之增加。模型厂商一方面在提升旗舰模型的能力上限,另一方面面对Agent大规模调用的新需求,也必须思考如何降低模型调用的成本和延迟。
因此,模型层已开始出现分化趋势。如今,同一家厂商也推出不同档次、不同价格的模型,flash模型扎堆的现象屡见不鲜。
Google在5月推出Gemini 3.5 Flash,瞄准日常开发和工作场景。7月31日,DeepSeek发布V4 Flash。8月下旬,Qwen3.8-Flash-Next和GLM-5.3-Flash接连亮相。
这些模型未必追求在所有基准测试中达到最高分,但也不是能力被削减的“阉割版”。它们是为高频、简单任务专门优化的新档次,且价格更划算。
以DeepSeek为例,它最近将V4 Flash更新至V4.1 Flash,并宣布在下一代Pro模型上线前,将V4 Pro的API请求路由至V4.1 Flash,并按Flash的价格计费。
过去,用户遇到任务时,第一反应是寻找最强的通用模型,能力越强越好。厂商的主线也是将一个旗舰模型打造得尽可能全能。
但现在,模型厂商开始根据任务复杂度、调用频率、响应速度和成本等因素重新划分能力,推出不同档次,让不同模型承担不同工作。
这种分化仍在继续推进。从使用场景看,代码、图像、语音等方向早已有专门优化的模型。办公、游戏等场景也在逐渐出现更贴合的模型。
毕竟不同场景的任务结构、上下文以及对速度、成本的要求各不相同,模型也就有了针对具体环节进行取舍的空间。
Jev是分化趋势中的一个极端样本
当其他模型还在通用框架中调整能力和价格时,Jev干脆将一类能力从通用模型中分离出来,单独制成一个模型。
开发者向Jev提供一段当前状态,再给一组预设问题,它返回的是Choice、Score或Boolean,并附上相应概率。Jev不解释为何如此选择,程序获取结果后可直接继续运行。
这对Agent至关重要。在Agent中,模型的输出往往直接决定下一步行动。此时,系统需要的可能不是一段完整的自然语言回答,而只是一个明确的信号。
这一设计背后,是Almeida对大型模型训练方式RLHF的反思。他认为,人类反馈会推动模型生成更符合人类偏好的回答,但也容易让模型养成另一种习惯:面对自己把握不大的问题,仍倾向于给出流畅、完整、笃定的答案。
Jev试图让模型将不确定性写入输出结果。如果模型判断某件事有八成把握,那么在长期统计中,其判断结果应接近八成正确。系统获得这个概率后,可自行设定门槛,把握高的任务自动放行,把握不足的任务转交给人或更强的模型。
不过,让模型实现可靠的自动化决策是Almeida想要抵达的方向,目前Jev尚未达到。
有开发者测试发现,同一个判断,正着问一遍、再反着问一遍,Jev给出的两组概率加起来有时会超过1。一个校准得当的概率系统不应如此。Jev不写自然语言,避开了编造像样答案的风险,但它给出的概率同样会出错。
调用不同模型的Agent入口更加重要
即便Jev仍存在不少问题,它已让行业看到另一种可能性:Agent中的智能也可以被拆解,一项复杂任务不一定由一个通用大模型包办。
例如,需要复杂推理时可调用强模型,大量简单的判断和筛选则可交给Jev这类更快、更便宜的模型。
Jev的名字也暗含深意。经济学中有“杰文斯悖论”的概念,指一种技术变得更高效、更便宜后,使用量反而会增加。那么,当Jev让“判断”动作变得更快、更便宜后,Agent越有可能在执行任务时频繁调用它,从而优化整体任务的效率和成本。
也就是说,任务本身逐渐成为Agent的核心。按任务调用不同模型,Agent执行的效率和性价比可能更高。
模型之间的关系也因此多了一种可能。过去,模型比拼的是谁更强,一个模型能力提升后,便将上一个替换掉。现在,以任务为核心,不同模型可各自承担擅长的部分,在同一个Agent中协作。
如果这种分工继续发展,一个能根据任务调用多个模型的Agent入口将变得更加重要。
已有Agent产品朝这个方向迈进。国内方面,腾讯WorkBuddy已支持在不同主流模型之间切换。WorkBuddy还设有Auto模式,系统会根据用户任务的类型、复杂度与上下文特征,自动选择当前最适合的模型进行响应。用户在不确定选择何种模型或面对混合型任务时,可交由系统决定。
海外的Cursor也在做类似尝试。它在今年8月推出的Cursor Router,会在每个请求交给模型之前,先根据任务类型、复杂度、上下文等信息进行判断,再从多个模型中选择最合适的一个。基本原则是,简单任务交给快速、便宜的模型;困难、长周期任务则交给前沿模型。
这些产品的思路一致,即把调度模型的任务交给系统按任务自动完成。用户只需提出任务,至于该派哪个模型上场,交给入口去安排,从而提高Agent使用的效率和降低成本。
长此以往,当模型逐渐走向各司其职,一个能灵活调配它们的Agent入口将越来越重要。想了解更多前沿技术动态,可访问九游官网获取资讯。
本文来自微信公众号“深流研究所”,作者:萧樱,36氪经授权发布。
围绕提供7×14小时在线客服与隐私安全保障,确保玩家数据无忧。,九游官网持续打磨更优质的服务。
九游官网深耕九游官网领域,用心服务每一位用户。
在jiuyou官网入口方面,九游官网提供贴心周到的支持。
九游官网以九游游戏平台为核心,带来高效便捷的体验。
想了解更多九游体育下载相关内容,尽在九游官网。