Skip to content
RobotWorld
返回论文库

PAPER DEEP DIVE

视觉语言模型LVLM视觉推理

保持一致:一致性约束增强LVLM鲁棒视觉推理

大型视觉语言模型视觉推理强但鲁棒性不足,本工作用一致性约束增强其鲁棒性。

Liqiang Jing, Xiong Zhou, Siddharth Varia, Neha Anna John, Xinya Du, Vassilis N. Ioannidis2026年7月23日3 分钟阅读
EN
Liqiang Jing, Xiong Zhou, Siddharth Varia, Neha Anna John, Xinya Du, Vassilis N. Ioannidis
UT Dallas · Amazon Web Services
arXiv:2607.21722 · 代码(即将发布)

一句话总结

本文提出 ConVBench——每张图配两道逻辑等价问题的视觉中心推理基准(六类:动作状态、复杂计数、空间、因果意图、常识、时序感知),用逻辑一致性与鲁棒准确率两个指标同时评估正确性与一致性;并提出 ConVLM,用 GRPO 强化学习加双奖励(准确率+一致性)让配对回答趋于一致,伪答案噪声下仍生效,7B 模型在 ConVBench 上超越 Claude-3.5-Sonnet-V2 一致性 +11.12%、准确率 +20.94%。

Figure 1. LVLM 对同一图的两道等价问题给出矛盾答案

Figure 1 — 同一张图,LVLM 对"击球手是否击中了球?"答"是",却对"球是飞向还是飞离击球手?"答"飞向"。若已击中应飞离——两个回答矛盾。

1. 研究背景与动机

大型视觉语言模型(LVLM)在图像描述等感知任务上表现强劲,但可靠的视觉推理仍远未解决。现有基准多聚焦符号化数学/科学题或简单视觉任务:数学科学类(MMBench、MathVista)模型常靠符号推理或领域文本知识而非忠实解读视觉证据通过;视觉中心类(BLINK)问题又太浅,"眨眼即解",无法评测复杂推理。

更关键的是,模型常对语义等价的查询生成不一致的答案——如图 1,说明它们利用虚假相关性而非真正理解。但当前基准几乎不检验这种鲁棒性。本文要同时填补"复杂视觉推理评测"与"跨查询一致性评测"两个缺口。

2. 核心方法

2.1 ConVBench 基准

每张图配两道逻辑等价问题,答案应对齐。六类:动作与状态、复杂计数、空间关系、因果与意图、常识推理、时序感知。构建用两阶段流水线:LVLM 先生成逻辑等价问答对,人工标注者校验——正确则接受、需小改则编辑、不可修则丢弃。保证可靠且不需穷尽人工撰写。

Figure 3. ConVBench 六类示例

Figure 3 — ConVBench 六类任务示例,每图配两道逻辑等价问题。

2.2 两类评测指标

  • 逻辑一致性(Consistency, Cons.):一致指标 $C_I$ 当两题都答对或都答错时为 1,否则 0。
  • 鲁棒准确率(Robust Accuracy, Acc.):$A_I$ 当两题都答对时为 1,否则 0——要求严格正确。

两指标互补:一致性高但准确率近零说明"一致地错",只有两者都高才是鲁棒推理。

2.3 ConVLM:一致性约束的强化学习

目标是在准确率最大化的同时强制跨查询一致性。设图像集 $\mathcal{I}$,策略 $\pi_\theta(o|I,q)$,等价对集 $\mathcal{G}(I)$,准确率奖励 $r_{acc}(I,q,o)\in[0,1]$,一致性指标 $r_{con}(o_1,o_2)\in\{0,1\}$,目标:

$$\max_\theta\ \mathbb{E}_{I,q,o}[r_{acc}(I,q,o)] \quad \text{s.t.}\ \mathbb{E}_{I,(q_1,q_2),(o_1,o_2)}[r_{con}(o_1,o_2)] \ge \tau$$

实践优化其拉格朗日松弛:

$$\max_\theta\ \mathbb{E}_{I,q,o}[r_{acc}(I,q,o)] + \gamma\,\mathbb{E}_{I,(q_1,q_2),(o_1,o_2)}[r_{con}(o_1,o_2)]$$

其中 $\gamma>0$ 权衡准确率与一致性。

Figure 2. ConVLM 流水线

Figure 2 — ConVLM 流水线。(i) 逻辑等价问题生成(proposer 用 GPT-4.1 按图+描述+物体信息生成配对问答)。(ii) 一致性强化学习(GRPO + 双奖励)。

2.4 逻辑等价问题生成

人工标注昂贵。用 proposer 模型(模型无关,可用廉价/开源 LVLM)自动生成。本文用 GPT-4.1 基于图像、描述、物体级信息(含包围框与类别)生成配对逻辑等价问答:

$$\{(q_1,a_1),(q_2,a_2)\}=\mathcal{P}(P(I,C,O))$$

其中 $I,C,O$ 为图像、描述、物体信息,$P(\cdot)$ 为提示模板。$q_1,q_2$ 逻辑等价即一题的答案可由另一题加视觉上下文推断:$a_1\leftarrow f(I,q_2,a_2,q_1)$ 或 $a_2\leftarrow f(I,q_1,a_1,q_2)$。

2.5 双奖励 GRPO

GRPO 目标(带裁剪与 KL 罚):

$$\mathcal{J}_{\mathrm{GRPO}}(\theta)=\mathbb{E}\!\left[\frac{1}{n}\sum_{i=1}^{n}\min\!\big(r_i(\theta)\hat{A}_i,\ \mathrm{clip}(r_i(\theta),1-\epsilon,1+\epsilon)\hat{A}_i\big)-\beta D_{\mathrm{KL}}(\pi_\theta\|\pi_{\mathrm{ref}})\right]$$

标准准确率奖励为二值(含正确答案为 1 否则 0),但依赖严格可验证性且伪答案有噪声时脆弱。故加一致性奖励:不保证正确但提供噪声容忍的互补信号,鼓励跨等价查询一致,准确率奖励锚定正确性。

两种一致性奖励:设 $q_1,q_2$ 各采样 $G$ 个回答 $\{o^1_1,\ldots,o^1_G\}$、$\{o^2_1,\ldots,o^2_G\}$。

  • 样本级(sample-wise):配对输出直接比较,$r_{con}=c(o^1_i,o^2_i)$,$c$ 一致则 1 否则 0。
  • 组级(group-wise):一输出对一组的平均,$r_{con}=\sum_{j=1}^{G}c(o^1_i,o^2_j)/G$。

总奖励 $r=r_{acc}+\gamma r_{con}$。奖励层级:都对且一致最高、都错且不一致最低、中间两种(对但不一致、错但一致)由 $\gamma$ 调节。

flowchart TB
    IMG["Image I"] --> PROP["Proposer (GPT-4.1)
generate logically
equivalent QA pairs"] CAP["Caption C"] --> PROP OBJ["Objects O"] --> PROP PROP --> QA1["q1, a1"] PROP --> QA2["q2, a2 (equivalent)"] QA1 --> GRPO["GRPO RL training"] QA2 --> GRPO GRPO --> RACC["accuracy reward r_acc"] GRPO --> RCON["consistency reward r_con"] RACC --> RALL["r = r_acc + gamma*r_con"] RCON --> RALL RALL --> MODEL["ConVLM: robust+consistent"] style RCON fill:#dbeafe,stroke:#2563eb style RALL fill:#dcfce7,stroke:#16a34a

3. 实验结果

8×A100(40G),OpenRLHF 框架,batch 256,AdamW 学习率 1e-7,每查询采样 8 响应($G=8$),$\beta=0$ 省略 KL,$\gamma=0.5$。训练从 MSCOCO 训练集随机采 5000 图。

3.1 ConVBench 主结果

模型Causal&Intent Con.Temporal Con.Spatial Con.Action State Con.Commonsense Con.Complex Counting Con.Avg Con.
Claude-3-5-sonnet-V261.9348.3065.0546.6067.9655.3366.02
Claude-3-7-sonnet75.0064.7774.7660.1965.0563.1172.82
GPT-4.184.0978.4179.6177.6780.5873.7971.84
Gemini-2.5-Pro78.4175.5783.5080.5873.7967.9667.96
InternVL3-8B40.9119.8949.5129.1349.5125.2447.57
ConVLM-7B81.8273.8679.6168.9365.3460.3973.36

7B 达 73.36% 平均一致性、66.83% 准确率;3B 达 69.34%/64.44%。比 Claude-3.5-Sonnet-V2 一致性 +11.12%、准确率 +20.94%。两变体均显著超同等或更大开源基线(InternVL3-14B、Qwen2.5-VL-7B)。

3.2 消融

模型ConVBench Cons.ConVBench Acc.V*Bench Acc.
ConVLM69.3464.4480.21
w/o-Acc(去准确率奖励)67.1261.7475.51
w/o-Con($\gamma=0.3$ 弱一致性)67.4160.2676.25
w/o-Data(随机训练数据)49.8941.6975.39
Base(Qwen2.5-VL-3B)41.8933.2364.39

准确率奖励贡献 ConVBench +2.22/+2.70、V*Bench +4.70;一致性奖励贡献 +1.93/+4.18、V*Bench +3.96——一致性训练同时提升一致性与准确率。生成数据贡献最大(+19.45/+22.75)。

3.3 一致性奖励形式对比

模型ConVBench Cons.ConVBench Acc.V*Bench Acc.
Qwen2.5-VL-3B41.8933.2364.39
w/ GroupCon66.8359.1972.77
w/ SampleCon67.1261.7475.51

两者均大幅超基线;SampleCon 略强,故最终采用样本级一致性奖励。

3.4 跨基准泛化

模型V*Bench Acc.InfoVQA ANLS
Gemini-2.5-Pro79.2084.00
Qwen2.5-VL-7B70.4080.70
ConVLM-3B80.2169.75
ConVLM-7B84.9081.90

ConVLM-7B 在 V*Bench 上 84.90 超 Gemini-2.5-Pro(79.20),说明一致性训练提升泛化而非过拟合基准。

4. 主要贡献

  • ConVBench:首个用配对逻辑等价问题同时评测复杂性与一致性的视觉中心推理基准,六类覆盖动作/计数/空间/因果/常识/时序。
  • 双指标:逻辑一致性与鲁棒准确率,区分"一致地错"与"鲁棒推理"。
  • ConVLM:GRPO + 双奖励(准确率+一致性),自动生成伪标签、噪声容忍,无严格答案监督亦有效。
  • SOTA:7B 超 Claude-3.5-Sonnet-V2 一致性 +11.12%、准确率 +20.94%,且泛化到 V*Bench 超 Gemini-2.5-Pro。

5.

优势函数归一化

$$ \hat{A}_{i}=\frac{r_{i}-\text{mean}(r)}{\text{std}(r)} $$

局限与展望

分析判断:一致性的二值判定 $c(\cdot)$ 对开放文本回答较粗——同义不同表述可能被判不一致;更细的语义一致性判定器或有助。proposer 依赖 GPT-4.1,质量与成本受其限制,廉价开源 proposer 的等价质量未充分验证。ConVBench 六类虽广但仍是自然图像桌面/场景,医疗/遥感等专业视觉推理未覆盖。InfoVQA 上 ConVLM-3B 的 ANLS(69.75)反而低于 Qwen2.5-VL-7B(80.70),说明一致性训练对文档/信息抽取类任务未必全胜——泛化边界需更细刻画。$\gamma=0.5$ 为固定值,自适应或课程式调节未探索。

6. 总结

本文的核心思想是用逻辑等价问题的一致性约束来逼出真正的视觉推理。ConVBench 每图配两道逻辑等价题,用一致性与鲁棒准确率双指标同时检验"答对"与"答得一致"。ConVLM 用 GRPO 强化学习加双奖励——准确率锚定正确、一致性容忍噪声且鼓励跨查询一致——在伪答案有噪声时仍生效。7B 模型在 ConVBench 上超 Claude-3.5-Sonnet-V2 一致性 +11.12%、准确率 +20.94%,并在 V*Bench 上超 Gemini-2.5-Pro,证明一致性训练提升的是泛化推理能力而非过拟合。

让模型对同一图的两道等价问题给出一致答案——一致性约束逼出的是真正的视觉理解。

相关论文