ACL爆冷:通用模型胜医疗专用,豆包深度求索领跑

admin4小时前4
ACL爆冷:通用模型胜医疗专用,豆包深度求索领跑
ACL Findings最新评测用多语言医疗错误检测基准揭示两大反直觉:通用模型整体胜过医疗专用,英语优势并不等于英语最强。豆包、深度求索在三语任务中领跑,压过GPT-4o与Gemini,提示医疗大模...