MedQ-Bench: Evaluating And Exploring Medical Image Quality Assessment Abilities In MLLMs - Takara TLDR

Medical Image Quality Assessment (IQA) serves as the first-mile safety gate
for clinical AI, yet existing approaches remain constrained by scalar,
score-based metrics and fail to reflect the descriptive, human-like reasoning
process central to expert evaluation. To address this gap, we introduce
MedQ-Bench, a comprehensive benchmark that establishes a perception-reasoning
paradigm for language-based evaluation of medical image quality with
Multi-modal Large Language Models (MLLMs). MedQ-Bench defines two complementary
tasks: (1) MedQ-Perception, which probes low-level perceptual capability via
human-curated questions on fundamental visual attributes; and (2)
MedQ-Reasoning, encompassing both no-reference and comparison reasoning tasks,
aligning model evaluation with human-like reasoning on image quality. The
benchmark spans five imaging modalities and over forty quality attributes,
totaling 2,600 perceptual queries and 708 reasoning assessments, covering
diverse image sources including authentic clinical acquisitions, images with
simulated degradations via physics-based reconstructions, and AI-generated
images. To evaluate reasoning ability, we propose a multi-dimensional judging
protocol that assesses model outputs along four complementary axes. We further
conduct rigorous human-AI alignment validation by comparing LLM-based judgement
with radiologists. Our evaluation of 14 state-of-the-art MLLMs demonstrates
that models exhibit preliminary but unstable perceptual and reasoning skills,
with insufficient accuracy for reliable clinical use. These findings highlight
the need for targeted optimization of MLLMs in medical IQA. We hope that
MedQ-Bench will catalyze further exploration and unlock the untapped potential
of MLLMs for medical image quality evaluation.

Source link

What's Hot

What to expect from free Perplexity AI Comet Browser: Enhanced multitasking?

TimeSeriesScientist: A General-Purpose AI Agent for Time Series Analysis – Takara TLDR

The Lean AI Lab’s Blueprint for Superhuman Productivity

MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs – Takara TLDR

TimeSeriesScientist: A General-Purpose AI Agent for Time Series Analysis – Takara TLDR

Think Right: Learning to Mitigate Under-Over Thinking via Adaptive, Attentive Compression – Takara TLDR

VLA-R1: Enhancing Reasoning in Vision-Language-Action Models – Takara TLDR

Former ARTnews Publisher Dies at 97

National Gallery of Art Closes as a Result of Government Shutdown

Almine Rech Closes London Gallery After More Than a Decade

Record Exec and Art Collector Gets Over 4 Years

What to expect from free Perplexity AI Comet Browser: Enhanced multitasking?

TimeSeriesScientist: A General-Purpose AI Agent for Time Series Analysis – Takara TLDR

The Lean AI Lab’s Blueprint for Superhuman Productivity

What's Hot

MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs – Takara TLDR

Related Posts

Subscribe to Updates