AI资讯
ACL爆冷:通用模型胜医疗专用,豆包深度求索领跑
ACL Findings最新评测用多语言医疗错误检测基准揭示两大反直觉:通用模型整体胜过医疗专用,英语优势并不等于英语最强。豆包、深度求索在三语任务中领跑,压过GPT-4o与Gemini,提示医疗大模型需重视过程监督与跨语种稳健性。
ACL Findings最新评测用多语言医疗错误检测基准揭示两大反直觉:通用模型整体胜过医疗专用,英语优势并不等于英语最强。豆包、深度求索在三语任务中领跑,压过GPT-4o与Gemini,提示医疗大模型需重视过程监督与跨语种稳健性。