分类:AI动态 标签:人工智能、大模型、开源项目、OpenAI
AI 圈的反常识选择:剥夺大模型的语言能力
过去三年,全行业都在教大模型怎么学会像人类一样「慢思考」,各家实验室拼命拉长推理链条,让模型在给出答案前默默自言自语几千个词。然而,前 OpenAI 研究员、ChatGPT 的共同发明者 Diogo Almeida 带着新公司 TypeSafe AI 和 4000 万美元融资回到牌桌时,却发布了一个完全相反的模型:Jev。
它既不能写工作周报,也不能陪用户深夜长聊,甚至连一个标点符号都吐不出来。Jev 走了一条完全相反的路:它不做文本生成,只输出确定性的结构化决策。 这不仅是一个新产品的发布,更像是对当前大模型技术范式的一次公然叫板。
给 AI 装上「反射神经」:告别高成本的文本中转
如今大部分工程师把大模型接入业务系统时,做的事情往往很荒谬。你明明只需要它回答「这封邮件是不是垃圾邮件」或者「在五个 API 接口里选一个」,但你不得不让一个拥有上千亿参数的庞然大物,在漫长的几秒钟里,一个词一个词地把一串 JSON 字符敲出来。
Jev 解决问题的方式极其粗暴。它根本就不是一个文本自回归模型。
在 Kahneman 著名的《思考,快与慢》中,人类的思维被分为两个系统。系统一是无意识的、极速的本能直觉;系统二是缓慢的、需要调动精力的逻辑推理。当下的主流大模型都在拼命卷系统二,而 Jev 走的是纯粹的「系统一模型」(System One Model)路线:
- 极速响应:所有决策在一次单向并行计算中同时产出,端到端延迟被压缩到 70 到 500 毫秒之间,比前沿大模型快 40 到 200 倍。
- 绝对格式:彻底消灭了结构化输出的格式幻觉,输出永远严格锁定在开发者预先定义的 Schema 里。
- 极致性价比:单次结构化决策的成本大约是 0.0004 美元,远低于传统大模型。
重新定义 Agent:用「系统一」打破执行摩擦
为什么 TypeSafe 会选择在这个时间点,做一个完全不吐字的模型?答案藏在正在全面铺开的 AI Agent 里。
无论是 Cursor、GitHub Copilot 还是各种企业级自动化工作流,工程师们发现现在的 Agent 之所以又卡又贵,往往不是因为核心逻辑不够聪明,而是中间的「执行摩擦」太大。一个完整的 Agent 任务通常包含几十个微小的决定,如果每一个微小动作都要调用一次千亿参数的超级大模型,延迟和成本会迅速失控。
行业被自回归文本模型绑架得太久了,以至于大家几乎默认了所有 AI 任务都必须通过自然语言去中转。而 Jev 的出现,实际上是在大模型的系统架构里插进了一层「前置反射弧」:
- 宏观规划:昂贵的前沿大模型充当统领全局的系统二,负责宏观规划和高难度思考。
- 高效执行:在第一线处理诸如工单分类、内容合规初筛、大批量数据打标等脏活累活时,交由 Jev 这样的系统一模型毫秒级搞定。
测试数据显示,在多个典型的企业工作流中,Jev 的准确率打平了部分主流大模型,而执行速度却拉开了几十倍的差距。
0 误差背后的黑盒与挑战
不过,把 Jev 看作一颗完美的银弹还为时尚早。在这份惊艳的技术答卷背面,依然存在明显的局限性:
- 可解释性的全面丧失:传统的思维链模型会把「为什么这么选」写在草稿纸上供审计追踪,而 Jev 的输出只有干瘪的选项和概率。在金融、医疗、法律等强监管领域,这种缺乏审计能力的决策机制容易撞上合规南墙。
- 技术细节封闭:TypeSafe 宣称发明了基于校准决策的强化学习(RLCD)新训练方法,但具体的奖励函数、网络架构及校准概率方法论均未公开,部分评估基准也缺乏第三方独立复现。
- 商业模式拷问:每 100 万 token 仅收 4 美分且输出完全免费的定价策略,在真实企业级高并发流量涌入时,能否维持收支平衡仍需市场检验。
总结
过去几年,所有人都在惊叹于 AI 越来越会说漂亮话。而 Jev 的出现证明,在沉默的机器世界里,行动往往比语言更重要。把模型做小、做快、做确定,或许正是 AI Agent 真正跑进大规模工业化落地的新方向。