E255|模型越来越强,为什么用户没感觉?再访阿里国际站总裁张阔

播放真实单集
Episode Summary真实 show notes
模型在榜单上越来越强,为什么真正把工作交给AI,还是需要人反复解释、检查和兜底? 半年前,我们与阿里国际站总裁张阔聊了Accio Work,以及Agent如何参与采购和日常经营。半年后,我们再次请到他,聊聊这半年来商家使用Accio Work的真实案例,试图回答这个问题:模型能力的提升,究竟有多少变成了商家工作里的进步? 张阔分享,很多模型的通用评测成绩已经接近满分,但团队在真实经营中,并没有感受到同样幅度的提升。为此,他们从实际业务中整理了107个任务,包括比较供应商报价、识别钓鱼邮件、预订船期和处理交易纠纷。据他介绍,在这套特定评测中,最前沿模型在无人干预条件下的任务通过率约为61%。 这些任务没有数学竞赛那么耀眼,却直接关系到商家的成本、交期和利润。一个好用的Agent,既要能把工作做完,也要让人用得起;既要理解工具和流程,也要理解这盘生意究竟想追求什么。 这期节目,我们聊聊榜单成绩与实际交付之间的落差、通用模型与垂直产品的竞争,以及当AI接手越来越多的执行工作,人还需要保留哪些判断。 【主播】 Yiwen,硅谷101主持人 【嘉宾】 张阔,阿里国际站总裁 【你将听到】 从写代码到做生意,Agent还差什么? 01:18 AI同事市场:编程之外,专业工作走到了哪一步? 02:38 商业任务为什么比编程更难? 03:48 从采购搜索到日常经营,Accio Work的任务边界如何扩展 06:12 商家案例:植物监测产品,从创意走到设计、供应链和销售 07:47 找工厂、比报价、拿样品:采购流程里,人和AI如何协作 通用模型越来越强,垂直产品还有什么优势? 10:13 中美Ag
Business Vocabulary规则派生 · 可核对
ai
Related Companies规则派生 · 可核对
Marketing Insight规则派生 · 可核对
商业启示与英文表达将由此基于真实内容萃取。当前为结构占位,不生成虚构事实。