AI 见闻
← 返回

# 推理模型

50 篇相关资讯

QVQ-Max:用证据思考的视觉推理模型

去年12月,我们推出了探索性模型QVQ-72B-Preview,但它存在很多问题。今天,我们正式发布视觉推理模型QVQ-Max的第一个版本。该模型不仅能“理解”图像和视频中的内容,还能利用这些信息进行分析和推理以提供解决方案。从数学问题到日常问题,从编程代码到艺术创作,QVQ-Max展示了令人印象深刻的能力。

Qwen Team Blog超过 1 年前

数学推理中的有效过程监督

近年来,大型语言模型(LLM)在数学推理方面取得了显著进步,但仍可能犯计算错误或逻辑错误,导致错误结论。此外,即使最终答案正确,这些模型仍可能编造看似合理的推理步骤,其最终答案建立在有缺陷的计算或推导之上,这削弱了LLM推理过程的可靠性和可信度。因此,自动识别推理过程中的错误对其可扩展监督变得日益重要。过程奖励模型(PRM)作为一种有前景的方法,旨在识别并缓解推理过程中的中间错误。在评估方面,以往研究主要依赖响应级Best-of-N(BoN)评估,即根据PRM从N个候选中选择得分最高的响应。今天,我们发布了一个新的最先进PRM,在构建PRM的未来研究中优于现有开源替代方案。

Qwen Team Blog超过 1 年前