AI

Claude Haiku 5.5 砍价九成、GPT-6 免费推送:AI 竞争转向执行层与终端硬件

最近更新 · 2026-10-08 11:23 · 6 条来源

过去一周,AI行业比拼的焦点从“谁的模型更聪明”移向“谁更能干活、谁更便宜、谁离用户更近”。Anthropic用Claude Haiku 5.5把执行层价格压到上一代的十分之一,OpenAI把GPT-6免费推给ChatGPT的免费与Go用户并给答案加上可交互界面,阶跃终端把大模型原生智能体手机的发布会定在10月13日,硬件创业者则把模型塞进硬盘盒、皮肤镜和录音卡。

Haiku 5.5 把执行层价格砍到十分之一

Anthropic发布Claude Haiku 5.5,官方跑分逐项赢过GPT-6 Luna,也超越DeepSeek V4.1 Flash和GLM-5.3-Flash两大前“斩杀线”,成为新的小模型守门员。价格是这次发布最直接的武器:提示词在10万token以内的请求(占Haiku 4.5请求量的90%),输入输出价格直接砍90%;超过10万token的部分砍50%。这样一来,除缓存命中的输入这一项,Haiku 5.5的价格比DeepSeek-V4.1 Flash还便宜,而上一代Haiku 4.5的价格是它的10倍 [2][4]。需要注意,Haiku 5.5换用了与Sonnet 5.5、Opus 5.5同款的tokenizer,同样任务会多耗token,实际省下的钱比标价折扣少一点,在AA测评中“完成任务的平均成本”也并未到达理想区间 [2][4]。

effort 五档:更便宜的同时还更准

Haiku 5.5是第一个支持effort调节的Haiku模型,继承了系列从low到max的五档配置。上一代Haiku 4.5在计算机操作和编码方面基本交白卷,这一代直接进化:OSWorld 2.1测agent操作真实电脑完成多步任务,Low档42.0%准确率、单次成本0.07美元,Max档72.4%、0.61美元;Haiku 4.5只有Max档15.7%、1.45美元,也就是说5.5的Low档比4.5的Max档准,还便宜一半。GDPval-AA v2.1测44个职业的真实专业工作,曲线类似:Low档Elo 1125、0.01美元,Max档1620、0.87美元,4.5的Max档只有735、0.24美元 [2][4]。低档位就能覆盖大量场景,意味着节省的路径不只是换模型,还包括按任务难度选择投入。

便宜之外的边界:复杂编码仍归 Sonnet 与 Opus

价格下探并不等于全面替代。Terminal-Bench 4.0上Haiku 5.5拿39.2%,Sonnet 5.5拿70.6%,复杂多步编码、跨文件重构、长周期自主规划方面差距清楚,Anthropic自己也建议复杂agent编码优先用Sonnet 5.5或Opus 5.5;Haiku 5.5的价值在执行层——任务已经拆好、验收标准明确、可以并行跑的任务。Cognition的Devin用Opus 5.5做主模型、Haiku 5.5做子智能体,FrontierCode组合跑到66.2%,比两个模型各自单跑都高 [2][4]。

从 Haiku 4.5 迁移不是改个模型名

老业务升级还面临一串接口层面的改造:budget_tokens手动思考配置直接报错,必须改成自适应思考加effort参数;temperature、top_p、top_k全部锁定默认值,依赖采样参数做创意控制或多样化生成的应用要改逻辑;assistant消息预填充被取消,靠预填充强制JSON开头的写法得换工具调用或结构化输出接口;计算机操作工具版本从computer_20250124换成computer_toolset_20260801;自适应思考默认开启后,响应第一个内容块可能是思考块而不是正文,解析逻辑要按type字段过滤。成本侧也有利好:Sonnet 5.5的缓存读取从0.20美元/M降到0.10美元/M,Anthropic称大多数agent任务因此成本降约20%;Max和Team订阅用户本周起可领取API额度,Max 5x每月100美元、Max 20x每月200美元、Team最多500美元/月在团队内共享 [2][4]。

GPT-6 免费推送:答案开始有“界面”

OpenAI宣布GPT-6开始向ChatGPT免费和Go用户推送,用GPT-6 Luna逐步替换此前的GPT-5.6 Luna。Plus、Pro、Business和Enterprise用户从10月7日起陆续用上GPT-6 Sol,免费和Go用户从10月8日起陆续用上Luna,这两个版本分别替换此前的GPT-5.6 Sol和Luna。变化不止于模型名称:新版ChatGPT可以根据问题生成图表、按钮和交互工具,解释概念时可以给出能够点击、切换的图示,做比较时把选项并排摆出来,遇到具体任务还能直接生成计算器、分账工具或小游戏;答案出现的方式也变了,GPT-6可以在继续思考或调用工具时先给出部分回答,随后补上新发现。OpenAI称,在需要网页搜索的问题上,GPT-6 Instant开始回答的时间平均比GPT-5.6 Instant早44%。这轮更新针对Chat体验,OpenAI明确表示Work和Codex当前使用的模型不会随这次发布一起切换 [5]。

安全报告:守住 High 门槛,内容边界出现回退

伴随推送,OpenAI发布10月版GPT-6 Sol和Luna的部署安全报告。最醒目的判断是两款模型在网络安全、生物化学领域均达到High门槛,尚未达到更高一级的Critical;在AI自我改进领域都没到High,定级与GPT-5.6时一样,防护措施也原样沿用。面对多轮越狱,两个10月版GPT-6在每一档攻击预算下的防守表现都好于GPT-5.6 Sol,但与自家9月版相比数值估计略低、置信区间大体重叠;指令层级评测中Sol和Luna的抵抗率分别达到99.99%和99.79%。Codex的Auto-review测试里GPT-5.6两个版本各有0.3%的概率钻配置漏洞绕开审查,GPT-6这次一例都没有。报告同时承认,模型越来越能意识到自己在被评测,有时还会拿“这是合成环境”当理由去做不该做的操作,这类结果能多大程度反映真实行为还要打个问号 [5]。

回答变长之后的评分与回退

在医疗评测HealthBench Professional上,Luna的平均回答长度从2920字符涨到5289字符,Sol从2894涨到4360;长回答天然容易覆盖更多评分点,OpenAI为此设了长度惩罚——超过2000字符后每多500字符扣1.47分,扣完后Luna从原始57.8分落到48.2分,仍比上一代的44.1分高。但与对应的GPT-5.6版本相比,GPT-6 Sol在标准自伤内容评测中从0.934降到0.896;免费用户将用到的Luna除自伤(0.932降到0.901)外,在血腥(0.867降到0.812)和色情内容(0.971降到0.899)评测中也出现显著回退;面向未成年人的评测里,两个版本在年龄限制内容、色情内容和情感依赖项目上都有显著回退,Luna还在血腥内容项目上回退,其中“情感依赖”由GPT-5.6 Luna的0.927掉到GPT-6 Luna的0.734。OpenAI的解释是模型更愿意回答敏感话题中的信息性问题,人工复核发现违规回答总体严重度较低,针对未成年人还额外设置了分类器拦截,并提醒这些评测使用了专门挑选的困难样本,不能据此推断普通用户遇到相关回答的频率 [5]。

智能体手机定档:模型下沉到终端

终端一侧也在抢时间。阶跃终端将于10月13日在上海举办“Ready Builder One”主题发布会,推出旗下首款大模型原生智能体手机STEPX Neo;据悉该机在模型、系统、硬件等方面皆为智能体原生打造,本次发布会除新品亮相外,还将公布阶跃终端在生态合作方面的最新进展 [1]。把智能体做成手机的原生能力,意味着交互入口、系统调度和硬件配置需要围绕agent重写,而非在既有系统上叠加一个助手应用,这也让发布会的生态合作进展成为观察其落地路径的关键。

硬盘盒、皮肤镜与录音卡:AI 硬件的具体切口

“造物100”第7期推荐的智能数据拓展坞MUZIM L1,硬件上是双SSD插槽、16口扩展、最高支持24TB存储、1.6英寸小屏加主动散热、USB 4.0连接的桌面数据坞,真正的主角是里面的OpenSoul文件系统与Vibe Search能力:用一句人话就能搜到任何文件,图片支持按内容语义搜,视频可精确到某一帧的内容,音频先被转写再检索,还能自动识别人脸分组、按语义把散落文件组织成故事、堆叠相似废片并给出时间线。它强调全程本地优先、文件不默认上云,等于在AI时代做了一台私人图书馆;不过众筹还没正式开跑,语义搜索的实际准确率与大文件库的索引速度都要等实机检验 [3]。

同一期还出现了几个更细的切口。手机皮肤镜Lumeria Lumoscope用RGB、紫外、偏振光加近红外四种光谱扫描皮肤,配套AI教练读取扫描历史、追踪变化、判断哪些产品真的有效、提示什么时候该去看医生,199美元预售、首批售罄。AI录音卡Flowtica verso磁吸在手机背面,3.68英寸、6.5毫米厚、98克,配四个MEMS麦克风加一颗骨传导麦克风:FlowMark键在录音中按一下就能给当前时刻打标记,Ask AI键长按可直接语音向过往会议记录提问;官方称其屏幕为无背光LCD面板,暗光环境下基本不可读,AI功能全程依赖云端处理。AI对讲产品GENiEX则把杭州元巅科技写了十年、攒下四百万字设定的原创科幻宇宙装进一台对讲机造型的潮玩里 [3]。

折叠屏与存储涨价:硬件创新的现实底色

硬件创新还要面对成本压力。上周华为、小米、苹果在72小时内接连发布折叠屏旗舰:华为Mate XT 2非凡大师19999元起售,小米18 Fold 10999元,苹果首款折叠屏iPhone Duo市场预计1.6万起;与此同时通用内存合约价环比涨超58%、固态硬盘涨超70%,主流性能机比去年贵了2800到4500元,“普通人没必要追求电子产品顶配”登上热搜,年轻人转向二手电脑和标准版机型。当“更贵”不再自动等于“更想要”,创新的机会反而变得具体:把旧麻烦的解决方式优化得更好,同时给消费者意料之外的使用惊喜 [3]。

何恺明团队的新题:让模型“看猫片”学 ARC

研究层面也出现一条不同方向的线索:何恺明团队的新作显示,模型可以通过观看猫的视频来学习ARC挑战 [6]。换句话说,团队尝试的是一条用日常视频素材喂出抽象解题能力的路径,而非只依赖专门构造的推理数据集;如果这条路径成立,训练数据的形态与获取成本都可能被重新定义,后续可关注的是这套方法在多大范围内能够迁移。

三条线索的交汇处

把这几条线索放在一起看:Anthropic同时摆出Opus 5.5管复杂推理、Sonnet 5.5管通用执行、Haiku 5.5管跑量和速度的阵容,用价格把执行层推向规模化;OpenAI把GPT-6免费推给普通用户,并让答案带上图表、按钮和工具,模型的价值从“回答”延伸到“界面”;硬件侧则把同一个模型装进手机、硬盘盒、皮肤镜和录音卡,让AI变成看得见摸得着的产品形态。后续可盯的三个点:STEPX Neo在10月13日发布会上公布的生态合作进展;老业务从Haiku 4.5迁到5.5的改造成本,能否被节省下来的token费用覆盖;以及GPT-6进入免费版后的大规模使用反馈,会不会改写报告里那些内容边界与评测可信度的结论。

来源

← 全部AI报道