Haiku 5.5独立评测43分:遥遥领先GPT-6 Luna,但最高档Token消耗超3倍
币界网消息,第三方评测机构Artificial Analysis公布Haiku 5.5的测试结果,该模型在综合智能指数中获得43分,比上一代的17分提高26分,超过GPT-6 Luna的38分和GLM-5.3 Flash的42分,接近Kimi K3的44分。Haiku 5.5在最高推理强度下每项评测任务平均输出约16.2万Tokens,是GPT-6 Luna的3.2倍,预估单任务成本约0.21美元,Luna为0.07美元。降低推理强度后,Haiku 5.5在高档获得38分,平均每项任务输出约5.5万Tokens,与GPT-6 Luna接近。在AutomationBench-AA自动化任务评测中,Haiku 5.5仅得35%,落后于Luna的53%。测试期间模型存在过度拒绝执行任务的问题,Anthropic正在修复,Artificial Analysis计划重新测试。