<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>空间推理 - Tag - 堂堂一跑堂</title><link>https://spacetop.win/tags/%E7%A9%BA%E9%97%B4%E6%8E%A8%E7%90%86/</link><description>空间推理 - Tag - 堂堂一跑堂</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>kingcopper@whu.edu.cn (WangTong)</managingEditor><webMaster>kingcopper@whu.edu.cn (WangTong)</webMaster><lastBuildDate>Sat, 13 Jun 2026 23:00:05 +0800</lastBuildDate><atom:link href="https://spacetop.win/tags/%E7%A9%BA%E9%97%B4%E6%8E%A8%E7%90%86/" rel="self" type="application/rss+xml"/><item><title>SpatialClaw：把遥感 VLM 的空间推理改成可执行代码</title><link>https://spacetop.win/2026/06/20260613_230004_twohour_remote_sensing_radar/</link><pubDate>Sat, 13 Jun 2026 23:00:05 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/20260613_230004_twohour_remote_sensing_radar/</guid><description><![CDATA[<h1 id="spatialclaw把遥感-vlm-的空间推理改成可执行代码" class="headerLink">
    <a href="#spatialclaw%e6%8a%8a%e9%81%a5%e6%84%9f-vlm-%e7%9a%84%e7%a9%ba%e9%97%b4%e6%8e%a8%e7%90%86%e6%94%b9%e6%88%90%e5%8f%af%e6%89%a7%e8%a1%8c%e4%bb%a3%e7%a0%81" class="header-mark"></a>SpatialClaw：把遥感 VLM 的空间推理改成可执行代码</h1><p><strong>结论：这一轮最值得单独深挖的是 <em>SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning</em>。它不是遥感原生论文，也没有在卫星影像 benchmark 上报告结果；但它给遥感 VLM 一个很直接的启发：空间推理不应只靠一次性文本回答，也不应只靠固定 schema 的工具调用，而应该让模型在一个有状态 Python kernel 里逐步写代码、调用感知工具、查看中间证据、修改分析路径，最后再提交答案。对大幅遥感影像、矢量图层、DEM、时间序列和 GIS 证据链来说，这个“代码即动作接口”的设定比普通 VQA prompt 更接近真实工作流。</strong></p>
<p>我按 2026-06-13 23:00 +08 检索公开来源，过滤 SAR、PolSAR、InSAR、radar-only、microwave-only 和 SAR-optical fusion 主线。本篇选择 2026-06-11 提交 arXiv 的 SpatialClaw。论文和官方 GitHub 均已公开，仓库说明包含 agent runtime、LangGraph workflow、persistent Jupyter kernel、AST safety check、planning/reflection loop、20 个 benchmark loader、perception tool wrappers、FastAPI GPU tool server、vLLM 发现与负载均衡、SLURM 复现实验管理。本文把它作为 CV-to-RS 迁移方向，而不是当作已有遥感 SOTA 结果引用。</p>
<p>这篇适合放进“遥感基础模型与多模态理解”。原因是它研究的是 VLM agent 的空间推理接口，而遥感 VLM 的很多关键失败都来自空间接口不足：模型看不清局部证据、不会把 tile 和全图坐标对齐、不会把 mask/box/polygon/DEM 统一计算、不会记录跨步骤证据，也不会把中间计算交给可验证工具。SpatialClaw 不直接解决遥感问题，但它给了一个可复用的系统骨架。</p>]]></description></item><item><title>SpatialSky-Bench：把遥感 VLM 评测从看图问答推到空间导航</title><link>https://spacetop.win/2026/06/20260613_010005_twohour_remote_sensing_radar/</link><pubDate>Sat, 13 Jun 2026 01:00:05 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/20260613_010005_twohour_remote_sensing_radar/</guid><description><![CDATA[<h1 id="spatialsky-bench把遥感-vlm-评测从看图问答推到空间导航" class="headerLink">
    <a href="#spatialsky-bench%e6%8a%8a%e9%81%a5%e6%84%9f-vlm-%e8%af%84%e6%b5%8b%e4%bb%8e%e7%9c%8b%e5%9b%be%e9%97%ae%e7%ad%94%e6%8e%a8%e5%88%b0%e7%a9%ba%e9%97%b4%e5%af%bc%e8%88%aa" class="header-mark"></a>SpatialSky-Bench：把遥感 VLM 评测从看图问答推到空间导航</h1><p><strong>结论：这一轮最值得单独跟踪的是 SpatialSky-Bench / Sky-VLM。它的价值不在于又做了一个遥感问答榜，而是把 VLM 的问题从“能不能看懂一张遥感图”推进到“能不能在无人机视角里理解方向、距离、高度、障碍物和降落安全”。这对遥感 VLM 很关键，因为很多真实任务不是静态 caption 或分类，而是带空间约束、风险判断和行动后果的动态决策。</strong></p>
<p>我按 2026-06-13 01:00 +08 检索公开来源，过滤了 SAR、PolSAR、InSAR、radar-only、microwave-only 和 SAR-optical fusion 方向。本篇选择 CVPR 2026 论文 <em>Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation</em>。论文有 arXiv、CVF Open Access 页面和官方 GitHub；其场景基于无人机视觉导航，不走雷达主线。需要注意的是，关联 UAVScenes 数据集包含相机与 LiDAR 标注，本文只把它作为 UAV 场景几何与视觉 benchmark 背景，不把 LiDAR 或三维重建作为主推荐方向。</p>
<p>这篇适合放进“遥感基础模型与多模态理解”类目。它提醒我们：遥感 VLM 的下一步不应只追求更会描述图像，而要能处理空间关系、尺度、可通行性、目标相对位置和安全决策。对城市应急、低空巡检、灾害侦察、无人机测绘和地面-空中协同，这比普通 VQA 更接近应用需求。</p>
<h2 id="背景" class="headerLink">
    <a href="#%e8%83%8c%e6%99%af" class="header-mark"></a>背景</h2><p>过去两年遥感 VLM 的评测大多围绕 caption、VQA、grounding、目标识别、场景分类和开放词表理解展开。这些任务很有必要，但它们通常仍是离线、静态、单图判断：模型看一张图，回答里面有什么、某个目标在哪里、图像属于什么类别。问题是，无人机和低空遥感场景里的“理解”往往不是静态语义，而是空间行动能力。</p>
<p>例如，一个巡检无人机需要判断前方是否可安全穿越，当前视角下目标在左前方还是右后方，障碍物高度是否构成风险，候选降落区域是否平整开阔，建筑、道路、树木和车辆之间的相对距离是否支持下一步动作。这类问题很难用普通图像描述衡量。一个 VLM 可以把图说得很流畅，却仍然无法稳定判断方向、距离和安全边界。</p>
<p>SpatialSky-Bench 把这个缺口显式化。它关注的是 UAV navigation 中的 spatial intelligence，也就是让模型在空中视角里完成环境感知和场景理解。CV-to-RS 的迁移路径很清楚：通用 VLM 里已有的视觉问答、空间推理和多模态指令能力，需要适配遥感/UAV 视角的尺度变化、俯视几何、遮挡、航迹连续性、地物类别和安全约束。</p>]]></description></item><item><title>过去 24 小时遥感 AI 雷达：GeoAgent 基准、空间推理接口与 Mask Prompt</title><link>https://spacetop.win/2026/06/20260612_103741_daily_remote_sensing_radar/</link><pubDate>Fri, 12 Jun 2026 10:37:41 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/20260612_103741_daily_remote_sensing_radar/</guid><description><![CDATA[<h1 id="过去-24-小时遥感-ai-雷达geoagent-基准空间推理接口与-mask-prompt" class="headerLink">
    <a href="#%e8%bf%87%e5%8e%bb-24-%e5%b0%8f%e6%97%b6%e9%81%a5%e6%84%9f-ai-%e9%9b%b7%e8%be%begeoagent-%e5%9f%ba%e5%87%86%e7%a9%ba%e9%97%b4%e6%8e%a8%e7%90%86%e6%8e%a5%e5%8f%a3%e4%b8%8e-mask-prompt" class="header-mark"></a>过去 24 小时遥感 AI 雷达：GeoAgent 基准、空间推理接口与 Mask Prompt</h1><p><strong>结论：今天的信号不在“又一个遥感 backbone”，而在地理智能系统的评测方式。</strong> 近 24 小时内，严格非 SAR/radar-only 的遥感 AI 新文并不多；更值得跟踪的是三条相互靠近的线：Earth-system agent benchmark 开始把遥感影像、格网数据、GIS 和模拟器放进同一个可执行工作流；通用 VLM 空间推理开始转向“代码作为行动接口”；mask/box prompt 从机器人世界模型里被证明是降低语言歧义的强约束。这三条线组合起来，正好对应遥感 VLM 的一个短板：能说，但未必能把证据落到对象、区域、时间和地图操作上。</p>
<p>我按 2026-06-12 10:37:41 +08:00 回看近 24 小时公开来源，过滤了 SAR、PolSAR、InSAR、radar-only、microwave-only 和 SAR-optical fusion 项。OpenReview、CVF、IEEE/ISPRS/ACM 在这个时间窗内没有检索到比 arXiv/官方 GitHub 更直接的新主线；GitHub/Hugging Face 只作为代码或数据可复现性补证据。</p>
<h2 id="今日-3-个重点" class="headerLink">
    <a href="#%e4%bb%8a%e6%97%a5-3-%e4%b8%aa%e9%87%8d%e7%82%b9" class="header-mark"></a>今日 3 个重点</h2><table>
  <thead>
      <tr>
          <th>排名</th>
          <th>论文/项目</th>
          <th style="text-align: right">来源时间</th>
          <th>任务</th>
          <th>数据/模态</th>
          <th>贡献</th>
          <th>代码/数据</th>
          <th style="text-align: right">分数</th>
          <th>为什么重要</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>1</td>
          <td>TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?</td>
          <td style="text-align: right">arXiv, 2026-06-11 10:26 UTC</td>
          <td>Earth-system agent 评测</td>
          <td>遥感影像、格网数据、GIS、模拟器、文档证据</td>
          <td>用 TerraAgent/ReAct 式可执行框架，把工具调用、过程指标和容差数值评分合在一起；403 个任务、24,500 个验证执行步骤</td>
          <td>论文页已公开；代码需继续跟踪</td>
          <td style="text-align: right">8.6</td>
          <td>遥感 AI 评测从“单图问答/单任务分割”走向“可执行地理工作流”，适合做 GeoFM/VLM 的下一代 benchmark</td>
      </tr>
      <tr>
          <td>2</td>
          <td>SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning</td>
          <td style="text-align: right">arXiv/GitHub, 2026-06-11 17:59 UTC</td>
          <td>VLM 空间推理</td>
          <td>图像/视频、3D/4D 空间任务</td>
          <td>训练自由框架，让 VLM 在持久 Python kernel 里逐步写代码，调用感知与几何工具，而不是一次性输出答案</td>
          <td>官方 GitHub: NVlabs/SpatialClaw</td>
          <td style="text-align: right">8.2</td>
          <td>对遥感 VLM 很可迁移：大幅影像、矢量图层、DEM、对象 mask 都天然适合“代码单元 + 中间证据”式推理</td>
      </tr>
      <tr>
          <td>3</td>
          <td>MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models</td>
          <td style="text-align: right">arXiv, 2026-06-11 16:02 UTC</td>
          <td>Mask prompt / 目标中心预测</td>
          <td>视频、mask、动作条件</td>
          <td>把 mask 同时作为输入提示和预测目标，用对象中心监督减弱背景噪声和语言歧义</td>
          <td>论文页已公开；官方代码需继续跟踪</td>
          <td style="text-align: right">7.4</td>
          <td>虽然是机器人/世界模型论文，但它给遥感一个清晰迁移点：box/mask prompt 可以作为变化检测、开放词汇分割和人工交互标注的证据锚点</td>
      </tr>
  </tbody>
</table>
<h2 id="1-terrabench遥感-agent-评测开始像真实地理工作流" class="headerLink">
    <a href="#1-terrabench%e9%81%a5%e6%84%9f-agent-%e8%af%84%e6%b5%8b%e5%bc%80%e5%a7%8b%e5%83%8f%e7%9c%9f%e5%ae%9e%e5%9c%b0%e7%90%86%e5%b7%a5%e4%bd%9c%e6%b5%81" class="header-mark"></a>1. TerraBench：遥感 Agent 评测开始像真实地理工作流</h2><p><strong>来源事实：</strong> TerraBench 于 2026-06-11 提交 arXiv。论文把问题定义为 grounded Earth-science reasoning，覆盖 Earth observation imagery、gridded data、GIS reasoning、simulation 和 document-grounded verification。它不是只问“图里有什么”，而是要求 agent 通过工具调用完成检索、地理处理、模拟和带证据的计算。论文报告 benchmark 包含 403 个任务、三个 track、八个应用域和 24,500 个验证执行步骤。</p>]]></description></item></channel></rss>