<?xml version="1.0" encoding="utf-8"?><feed xmlns="http://www.w3.org/2005/Atom" xml:lang="en"><generator uri="https://jekyllrb.com/" version="4.4.1">Jekyll</generator><link href="/feed.xml" rel="self" type="application/atom+xml" /><link href="/" rel="alternate" type="text/html" hreflang="en" /><updated>2026-05-19T16:50:50+00:00</updated><id>/feed.xml</id><title type="html">VU Lab</title><subtitle>The demo site for Bulma Clean Theme, made for Jekyll and GitHub pages websites
</subtitle><entry><title type="html">GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning</title><link href="/research/GSMem/" rel="alternate" type="text/html" title="GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning" /><published>2026-03-30T00:00:00+00:00</published><updated>2026-03-30T00:00:00+00:00</updated><id>/research/GSMem</id><content type="html" xml:base="/research/GSMem/"><![CDATA[<p>This placeholder project studies how embodied agents can combine vision, language, and action context to build richer scene representations in unstructured environments.</p>

<p>Current directions include long-tail object understanding, semantic grounding under ambiguity, and robust multimodal fusion for agents that must act with incomplete observations.</p>

<p>This page is a placeholder for future project details, papers, demos, and datasets.</p>]]></content><author><name>VU Lab</name></author><category term="research" /><summary type="html"><![CDATA[This placeholder project studies how embodied agents can combine vision, language, and action context to build richer scene representations in unstructured environments.]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="/img/research/research-placeholder-01.svg" /><media:content medium="image" url="/img/research/research-placeholder-01.svg" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning</title><link href="/highlights/gsmem/" rel="alternate" type="text/html" title="GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning" /><published>2026-03-30T00:00:00+00:00</published><updated>2026-03-30T00:00:00+00:00</updated><id>/highlights/highlight-GSMem</id><content type="html" xml:base="/highlights/gsmem/"><![CDATA[<p>This project studies how embodied agents can combine vision, language, and action context to build richer scene representations in unstructured environments.</p>

<p>Current directions include long-tail object understanding, semantic grounding under ambiguity, and robust multimodal fusion for agents that must act with incomplete observations.</p>]]></content><author><name>VU Lab</name></author><category term="highlights" /><category term="Embodied AI" /><category term="3D Vision" /><summary type="html"><![CDATA[This project studies how embodied agents can combine vision, language, and action context to build richer scene representations in unstructured environments.]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="/img/research/research-placeholder-01.svg" /><media:content medium="image" url="/img/research/research-placeholder-01.svg" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Reconstruction Matters: Learning Geometry-Aligned BEV Representation through 3D Gaussian Splatting</title><link href="/research/Splat2BEV/" rel="alternate" type="text/html" title="Reconstruction Matters: Learning Geometry-Aligned BEV Representation through 3D Gaussian Splatting" /><published>2026-03-29T00:00:00+00:00</published><updated>2026-03-29T00:00:00+00:00</updated><id>/research/Splat2BEV</id><content type="html" xml:base="/research/Splat2BEV/"><![CDATA[<p>This placeholder project focuses on how embodied agents maintain useful spatial memory over long time horizons while reasoning about goals, constraints, and uncertainty.</p>

<p>We are interested in navigation policies, memory-augmented world models, and planning systems that remain effective when tasks require multi-step reasoning across large spaces.</p>

<p>This page is a placeholder for future project details, papers, demos, and datasets.</p>]]></content><author><name>VU Lab</name></author><category term="research" /><summary type="html"><![CDATA[This placeholder project focuses on how embodied agents maintain useful spatial memory over long time horizons while reasoning about goals, constraints, and uncertainty.]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="/img/research/research-placeholder-02.svg" /><media:content medium="image" url="/img/research/research-placeholder-02.svg" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">When ‘YES’ Meets ‘BUT’: Can AI Comprehend Contradictory Humor?</title><link href="/research/yesbut-v2/" rel="alternate" type="text/html" title="When ‘YES’ Meets ‘BUT’: Can AI Comprehend Contradictory Humor?" /><published>2026-02-20T00:00:00+00:00</published><updated>2026-02-20T00:00:00+00:00</updated><id>/research/yesbut-v2</id><content type="html" xml:base="/research/yesbut-v2/"><![CDATA[<h2 id="abstract">Abstract</h2>

<p>YESBUT (v1 &amp; v2) investigates whether multimodal AI systems can comprehend contradictory humor in comics. The work focuses on comparative reasoning: models must connect two related visual situations, identify the apparent agreement implied by “yes,” and then recognize the contradiction introduced by “but.”</p>

<h2 id="authors">Authors</h2>

<p>Tuo Liang, Zhe Hu, Jing Li, Hao Zhang, Yiren Lu, Yunlai Zhou, Yiran Qiao, Disheng Liu, Jierui Peng, Jing Ma, Yu Yin</p>

<h2 id="links">Links</h2>

<ul>
  <li><a href="/projects/yesbut-v2/">Project page</a></li>
  <li><a href="https://arxiv.org/pdf/2503.23137.pdf">Paper</a></li>
  <li><a href="https://huggingface.co/datasets/zhehuderek/YESBUT_Benchmark">Dataset</a></li>
</ul>]]></content><author><name>VU Lab</name></author><category term="research" /><summary type="html"><![CDATA[Abstract]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="/projects/yesbut-v2/static/images/intro_example.jpg" /><media:content medium="image" url="/projects/yesbut-v2/static/images/intro_example.jpg" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Expo-GS: Exposure-Aware Signed Distance Function in Gaussian Splatting for High Dynamic Range</title><link href="/research/expo-gs/" rel="alternate" type="text/html" title="Expo-GS: Exposure-Aware Signed Distance Function in Gaussian Splatting for High Dynamic Range" /><published>2026-02-18T00:00:00+00:00</published><updated>2026-02-18T00:00:00+00:00</updated><id>/research/expo-gs</id><content type="html" xml:base="/research/expo-gs/"><![CDATA[<h2 id="abstract">Abstract</h2>

<p>Expo-GS studies high dynamic range reconstruction with Gaussian Splatting. By incorporating exposure awareness into a signed distance formulation, the method aims to better handle scenes captured under challenging brightness variation and exposure inconsistency.</p>

<h2 id="authors">Authors</h2>

<p>Chaoda Song, Yiren Lu, Xinpeng Li, Yunlai Zhou, Yanyan Zhang, Yu Yin, Vipin Chaudhary</p>

<h2 id="links">Links</h2>

<ul>
  <li><a href="https://icml.cc/virtual/2026/poster/66548">ICML poster</a></li>
</ul>]]></content><author><name>VU Lab</name></author><category term="research" /><summary type="html"><![CDATA[Abstract]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="/img/research/Expo-GS.jpg" /><media:content medium="image" url="/img/research/Expo-GS.jpg" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Segment then Splat: Unified 3D Open-Vocabulary Segmentation via Gaussian Splatting</title><link href="/research/Segment-then-Splat/" rel="alternate" type="text/html" title="Segment then Splat: Unified 3D Open-Vocabulary Segmentation via Gaussian Splatting" /><published>2025-10-26T00:00:00+00:00</published><updated>2025-10-26T00:00:00+00:00</updated><id>/research/Segment-then-Splat</id><content type="html" xml:base="/research/Segment-then-Splat/"><![CDATA[<p>This placeholder project studies how embodied agents can combine vision, language, and action context to build richer scene representations in unstructured environments.</p>

<p>Current directions include long-tail object understanding, semantic grounding under ambiguity, and robust multimodal fusion for agents that must act with incomplete observations.</p>

<p>This page is a placeholder for future project details, papers, demos, and datasets.</p>]]></content><author><name>VU Lab</name></author><category term="research" /><summary type="html"><![CDATA[This placeholder project studies how embodied agents can combine vision, language, and action context to build richer scene representations in unstructured environments.]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="/img/research/segment-then-splat.gif" /><media:content medium="image" url="/img/research/segment-then-splat.gif" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Praxis-vlm: Vision-grounded decision making via text-driven reinforcement learning</title><link href="/research/praxis-vlm/" rel="alternate" type="text/html" title="Praxis-vlm: Vision-grounded decision making via text-driven reinforcement learning" /><published>2025-10-24T00:00:00+00:00</published><updated>2025-10-24T00:00:00+00:00</updated><id>/research/praxis-vlm</id><content type="html" xml:base="/research/praxis-vlm/"><![CDATA[<h2 id="abstract">Abstract</h2>

<p>Praxis-VLM explores vision-grounded decision making through text-driven reinforcement learning. The work studies how language supervision and visual grounding can be combined to improve decision-making behavior in multimodal systems.</p>

<h2 id="authors">Authors</h2>

<p>Zhe Hu, Jing Li, Zhongzhu Pu, Hou Pong Chan, Yu Yin</p>

<h2 id="links">Links</h2>

<ul>
  <li><a href="https://arxiv.org/pdf/2503.16965">Paper</a></li>
  <li><a href="https://github.com/Derekkk/Praxis-VLM">Code</a></li>
</ul>]]></content><author><name>VU Lab</name></author><category term="research" /><summary type="html"><![CDATA[Abstract]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="/img/research/praxis_vlm.jpg" /><media:content medium="image" url="/img/research/praxis_vlm.jpg" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Fix False Transparency by Noise Guided Splatting</title><link href="/research/NGS/" rel="alternate" type="text/html" title="Fix False Transparency by Noise Guided Splatting" /><published>2025-10-17T00:00:00+00:00</published><updated>2025-10-17T00:00:00+00:00</updated><id>/research/NGS</id><content type="html" xml:base="/research/NGS/"><![CDATA[<h2 id="abstract">Abstract</h2>

<p>Noise Guided Splatting studies the false transparency artifact in 3D Gaussian Splatting. The method injects opaque noise Gaussians into object volumes during training, encouraging surface Gaussians to learn higher opacity and produce cleaner geometry-aware reconstructions.</p>

<h2 id="authors">Authors</h2>

<p>Aly El Hakie, Yiren Lu, Yu Yin, Michael Jenkins, Yehe Liu</p>

<h2 id="links">Links</h2>

<ul>
  <li><a href="https://opsiclear.github.io/ngs/">Project page</a></li>
  <li><a href="https://arxiv.org/pdf/2510.15736">Paper</a></li>
</ul>]]></content><author><name>VU Lab</name></author><category term="research" /><summary type="html"><![CDATA[Abstract]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="/img/research/NGS.png" /><media:content medium="image" url="/img/research/NGS.png" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Spatial Intelligence in Vision-Language Models: A Comprehensive Survey</title><link href="/research/spatial-vlm-survey/" rel="alternate" type="text/html" title="Spatial Intelligence in Vision-Language Models: A Comprehensive Survey" /><published>2025-10-01T00:00:00+00:00</published><updated>2025-10-01T00:00:00+00:00</updated><id>/research/highlight-spatial-vlm-survey</id><content type="html" xml:base="/research/spatial-vlm-survey/"><![CDATA[<h2 id="abstract">Abstract</h2>

<p>Vision-Language Models (VLMs) have achieved remarkable progress in language-grounded visual understanding, yet a critical gap remains: spatial intelligence. This survey provides a comprehensive overview of recent advances, taxonomies, and evaluations toward building spatially intelligent AI systems.</p>

<h2 id="authors">Authors</h2>

<p>Disheng Liu, Tuo Liang, Zhe Hu, Jierui Peng, Yiren Lu, Yi Xu, Yun Fu, Yu Yin</p>

<h2 id="links">Links</h2>

<ul>
  <li><a href="https://www.techrxiv.org/users/992599/articles/1354538/master/file/data/Spatial_VLM_Survey_Techrxiv/Spatial_VLM_Survey_Techrxiv.pdf">Paper (TechRxiv)</a></li>
  <li><a href="/projects/awesome-spatial-vlms/">Project Website</a></li>
  <li><a href="https://github.com/vulab-AI/Awesome-Spatial-VLMs">GitHub</a></li>
</ul>]]></content><author><name>VU Lab</name></author><category term="highlights" /><category term="Vision-Language Models" /><category term="Spatial Intelligence" /><category term="Survey" /><summary type="html"><![CDATA[Abstract]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="/img/research/Spatial_VLM.jpg" /><media:content medium="image" url="/img/research/Spatial_VLM.jpg" xmlns:media="http://search.yahoo.com/mrss/" /></entry><entry><title type="html">Spatial Intelligence in Vision-Language Models: A Comprehensive Survey</title><link href="/research/spatial-vlm-survey/" rel="alternate" type="text/html" title="Spatial Intelligence in Vision-Language Models: A Comprehensive Survey" /><published>2025-10-01T00:00:00+00:00</published><updated>2025-10-01T00:00:00+00:00</updated><id>/research/spatial-vlm-survey</id><content type="html" xml:base="/research/spatial-vlm-survey/"><![CDATA[<h2 id="abstract">Abstract</h2>

<p>Vision-Language Models (VLMs) have achieved remarkable progress in language-grounded visual understanding, yet a critical gap remains: spatial intelligence. This survey provides a comprehensive overview of recent advances, taxonomies, and evaluations toward building spatially intelligent AI systems.</p>

<h2 id="authors">Authors</h2>

<p>Disheng Liu, Tuo Liang, Zhe Hu, Jierui Peng, Yiren Lu, Yi Xu, Yun Fu, Yu Yin</p>

<h2 id="links">Links</h2>

<ul>
  <li><a href="https://www.techrxiv.org/users/992599/articles/1354538/master/file/data/Spatial_VLM_Survey_Techrxiv/Spatial_VLM_Survey_Techrxiv.pdf">Paper (TechRxiv)</a></li>
  <li><a href="/projects/awesome-spatial-vlms/">Project Website</a></li>
  <li><a href="https://github.com/vulab-AI/Awesome-Spatial-VLMs">GitHub</a></li>
</ul>]]></content><author><name>VU Lab</name></author><category term="research" /><summary type="html"><![CDATA[Abstract]]></summary><media:thumbnail xmlns:media="http://search.yahoo.com/mrss/" url="/img/research/Spatial_VLM.jpg" /><media:content medium="image" url="/img/research/Spatial_VLM.jpg" xmlns:media="http://search.yahoo.com/mrss/" /></entry></feed>