PANews 7月29日消息,Kimi宣布开源多模态大模型视觉感知评测基准PerceptionBench,旨在将视觉感知能力拆解为10项原子级能力进行独立评估,涵盖视觉关系、计数、属性、深度与3D、定位、比较、细粒度识别、上下文整合、OCR及幻觉识别等维度。该基准基于42个现有评测集中的模型失败案例构建,共包含3000道经人工验证的问题,每题仅考察单一视觉能力,无需推理或外部知识。 评测结果显示,在16款前沿多模态大模型中,没有任何模型整体准确率超过60%。
Kimi开源PerceptionBench视觉感知基准,GPT-5.6-Sol准确率居首但无模型突破60%
其他语言标题
- EnglishKimi open-sources PerceptionBench visual perception benchmark, GPT-5.6-Sol achieves the highest accuracy but no model surpasses 60%.
- 한국어Kimi가 PerceptionBench 시각 인식 벤치마크를 오픈소스로 공개했으며, GPT-5.6-Sol의 정확도가 가장 높지만 60%를 넘는 모델은 없다.