<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>GeoFM - Tag - 堂堂一跑堂</title><link>https://spacetop.win/tags/geofm/</link><description>GeoFM - Tag - 堂堂一跑堂</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>kingcopper@whu.edu.cn (WangTong)</managingEditor><webMaster>kingcopper@whu.edu.cn (WangTong)</webMaster><lastBuildDate>Tue, 16 Jun 2026 15:00:04 +0800</lastBuildDate><atom:link href="https://spacetop.win/tags/geofm/" rel="self" type="application/rss+xml"/><item><title>DEO：用双教师蒸馏把 DINOv3 的 RGB 语义注入多光谱 GeoFM</title><link>https://spacetop.win/2026/06/20260616_150004_twohour_remote_sensing_radar/</link><pubDate>Tue, 16 Jun 2026 15:00:04 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/20260616_150004_twohour_remote_sensing_radar/</guid><description><![CDATA[<h1 id="deo用双教师蒸馏把-dinov3-的-rgb-语义注入多光谱-geofm" class="headerLink">
    <a href="#deo%e7%94%a8%e5%8f%8c%e6%95%99%e5%b8%88%e8%92%b8%e9%a6%8f%e6%8a%8a-dinov3-%e7%9a%84-rgb-%e8%af%ad%e4%b9%89%e6%b3%a8%e5%85%a5%e5%a4%9a%e5%85%89%e8%b0%b1-geofm" class="header-mark"></a>DEO：用双教师蒸馏把 DINOv3 的 RGB 语义注入多光谱 GeoFM</h1><p><strong>结论：这一轮最值得补进雷达的是 CVPR 2026 Highlight 论文 <em>Brewing Stronger Features: Dual-Teacher Distillation for Multispectral Earth Observation</em>。它提出 DEO，用一个多光谱 EMA teacher 学 Sentinel-2 10 通道表示，再用冻结的光学 VFM teacher（默认 DINOv3）把 RGB 语义和 patch-level 结构蒸馏到同一个学生模型里。论文的关键信号不是“再训练一个遥感 backbone”，而是把通用视觉基础模型和多光谱 EO 基础模型之间的接口说清楚：如果目标是让 RGB 光学语义迁移到多光谱，预训练目标最好和 DINO/DINOv3 这类 contrastive self-distillation 范式对齐，而不是只靠 masked image modeling 做局部重建。</strong></p>
<p>我按 2026-06-16 15:00 +08 检索公开来源，并过滤 SAR、PolSAR、InSAR、radar-only、microwave-only 与 SAR-optical fusion 主线工作。DEO 的训练主线是 fMoW-Sentinel / fMoW-RGB 的光学与 Sentinel-2 多光谱数据；论文确实在相关工作和对比方法中提到含雷达路线，但本篇只讨论它对非 SAR 光学/多光谱 GeoFM 的价值。同期本地文章已经覆盖 FusionRS、RATS、Gaze Heads、TTABC、Clay-CNN Hybrids、AI4Land、MaskWAM、GeoFM layer probing、CoastlineVLM、Stateful Visual Encoders、LG-SAM、VecLang、TerraBench、OSTB 等方向，因此这里不重复已有条目。</p>]]></description></item><item><title>过去 24 小时遥感 AI 雷达：VLM 要看对区域，GeoFM 要接对任务，TTA 要有证据</title><link>https://spacetop.win/2026/06/20260616_090002_daily_remote_sensing_radar/</link><pubDate>Tue, 16 Jun 2026 09:00:02 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/20260616_090002_daily_remote_sensing_radar/</guid><description><![CDATA[<h1 id="过去-24-小时遥感-ai-雷达vlm-要看对区域geofm-要接对任务tta-要有证据" class="headerLink">
    <a href="#%e8%bf%87%e5%8e%bb-24-%e5%b0%8f%e6%97%b6%e9%81%a5%e6%84%9f-ai-%e9%9b%b7%e8%be%bevlm-%e8%a6%81%e7%9c%8b%e5%af%b9%e5%8c%ba%e5%9f%9fgeofm-%e8%a6%81%e6%8e%a5%e5%af%b9%e4%bb%bb%e5%8a%a1tta-%e8%a6%81%e6%9c%89%e8%af%81%e6%8d%ae" class="header-mark"></a>过去 24 小时遥感 AI 雷达：VLM 要看对区域，GeoFM 要接对任务，TTA 要有证据</h1><p><strong>结论：过去 24 小时最强信号不是单个遥感 SOTA，而是几条方法线正在合到一起。</strong> 第一，Gaze Heads 说明 VLM 的区域描述可以被少数 attention heads 追踪和干预，这给遥感 VQA、开放词汇分割和变化解释提供了“看没看对区域”的可审计机制。第二，TTABC 把 CLIP/VLM 的 test-time adaptation 从刷榜拉回到证据、代理目标和 shift 类型的受控比较，对跨城市、跨季节、跨 GSD 遥感部署很关键。第三，Clay-CNN Hybrids 和 AI4Land 提醒我们，GeoFM 不一定要替代 U-Net 或业务管线，很多时候更适合作为上下文、先验和全球尺度生产系统的一部分。第四，RATS、Adaptive Visual Token Selection 和 OmniVideo-100K 这类 CV/ML 新工作分别给出 part-level token、层级 token 选择、结构化 evidence chain 的迁移路径。今天最值得做的研究方向是：<strong>把 box/mask prompt 作为空间锚点，用 gaze/head steering 约束 VLM 看哪里，再用 CLIP/GeoFM 的轻量 TTA 校准目标域类别、边界和置信度，最终输出 mask/polygon、证据区域、置信度和人工复核优先级。</strong></p>
<p>我按 2026-06-16 09:00:02 +08:00 回看公开来源，重点检查 arXiv cs.CV 2026-06-15 recent 批次和近 3 个月内仍在形成趋势的 GeoFM/VLM/TTA 工作。本篇过滤 SAR、PolSAR、InSAR、radar-only、microwave-only 和 SAR-optical fusion 主线；若论文来自通用 CV/ML，我只保留能明确迁移到光学、多光谱、VHR、UAV 或地理大数据任务的部分。</p>]]></description></item><item><title>Clay-CNN Hybrids：GeoFM 做滑坡制图，别急着替换 U-Net</title><link>https://spacetop.win/2026/06/20260616_030002_twohour_remote_sensing_radar/</link><pubDate>Tue, 16 Jun 2026 03:00:02 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/20260616_030002_twohour_remote_sensing_radar/</guid><description><![CDATA[<h1 id="clay-cnn-hybridsgeofm-做滑坡制图别急着替换-u-net" class="headerLink">
    <a href="#clay-cnn-hybridsgeofm-%e5%81%9a%e6%bb%91%e5%9d%a1%e5%88%b6%e5%9b%be%e5%88%ab%e6%80%a5%e7%9d%80%e6%9b%bf%e6%8d%a2-u-net" class="header-mark"></a>Clay-CNN Hybrids：GeoFM 做滑坡制图，别急着替换 U-Net</h1><p><strong>结论：这一轮最值得补进雷达的是 2026-06-12 提交到 arXiv 的 <em>Clay-CNN Hybrids: Leveraging Geo-Foundational Models as Auxiliary Context for Landslide Detection</em>。它的结论很克制，但很有用：在 Landslide4Sense 滑坡像素级分割上，Clay v1.5 直接当主干并不比 U-Net 强；真正有效的是把 Clay 的预训练表征作为 U-Net bottleneck 的辅助上下文，再用两阶段 LoRA 微调。最佳 Hybrid U-Net + Clay 在三种随机种子下得到 64.5±1.8% F1，高于 U-Net baseline 的 59.9%，也高于论文引用的 Prithvi-EO-2.0 在同一 benchmark 上的 60.7%。这篇文章提醒遥感基础模型研究：GeoFM 的价值不一定是取代所有任务网络，而是给强空间归纳偏置的模型补上更好的光谱和地理语义先验。</strong></p>
<p>我按 2026-06-16 03:00 +08 检索公开来源，并过滤 SAR、PolSAR、InSAR、radar-only、microwave-only 与 SAR-optical fusion 主线工作。本篇选择的是 Sentinel-2 多光谱滑坡制图。Landslide4Sense 的输入里包含 DEM 和 slope，其中 DEM/slope 来源与 ALOS PALSAR 产品有关，但论文任务不是 SAR 影像识别，也没有使用 SAR backscatter、coherence、interferometry 或 SAR-optical fusion 作为主线。这里把它视为光学多光谱 + 地形先验的灾害制图工作。</p>]]></description></item><item><title>OSMGraphCLIP：位置表征不一定要从卫星像素开始</title><link>https://spacetop.win/2026/06/20260615_210002_twohour_remote_sensing_radar/</link><pubDate>Mon, 15 Jun 2026 21:00:02 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/20260615_210002_twohour_remote_sensing_radar/</guid><description><![CDATA[<h1 id="osmgraphclip位置表征不一定要从卫星像素开始" class="headerLink">
    <a href="#osmgraphclip%e4%bd%8d%e7%bd%ae%e8%a1%a8%e5%be%81%e4%b8%8d%e4%b8%80%e5%ae%9a%e8%a6%81%e4%bb%8e%e5%8d%ab%e6%98%9f%e5%83%8f%e7%b4%a0%e5%bc%80%e5%a7%8b" class="header-mark"></a>OSMGraphCLIP：位置表征不一定要从卫星像素开始</h1><p><strong>结论：这一轮最值得补进雷达的是 2026-06-06 提交到 arXiv 的 <em>OSMGraphCLIP: Learning Global Location Representations from OpenStreetMap Graphs</em>。它不是一个新的遥感影像 backbone，也不是 VLM 看图问答，而是把 OpenStreetMap 里的道路、建筑、土地利用、POI 等对象组织成异构图，再用 CLIP 式对比学习训练全球 location encoder。最值得关注的地方是：它在 24 个下游地理预测任务上和 GeoCLIP、SatCLIP、AlphaEarth、Copernicus-FM 等基线比较，证明“结构化地图拓扑”本身可以成为地理基础模型的监督模态，尤其适合社会经济、公共健康、城市功能这类卫星像素只能间接表达的任务。</strong></p>
<p>我按 2026-06-15 21:00 +08 检索公开来源，并过滤 SAR、PolSAR、InSAR、radar-only、microwave-only 与 SAR-optical fusion 主线工作。本篇选择 OSMGraphCLIP，是因为它和前几轮 VLM、变化检测、GeoFM layer probing 不重复：它不从影像端继续堆模型，而是把 GIS 矢量语义和拓扑关系推到 location representation 的预训练层。</p>
<p>需要先说明边界：OSMGraphCLIP 不是遥感影像解译模型，训练监督也不使用卫星影像。它进入遥感 AI 雷达的理由是 CV-to-RS / GIS-to-RS 的迁移价值很明确：遥感基础模型擅长看地表外观，但很多下游任务真正需要的是“这个地方如何被使用、道路如何连接、设施如何分布、建筑和 POI 如何组织”。这些信息在 OSM 图里是显式的，在卫星像素里通常只是弱代理。</p>
<h2 id="背景" class="headerLink">
    <a href="#%e8%83%8c%e6%99%af" class="header-mark"></a>背景</h2><p>过去一批地理 location encoder 多数依赖坐标和影像对齐。GeoCLIP 用地面图像和 GPS 学位置表征，SatCLIP 用 Sentinel-2 影像和坐标做对比学习，AlphaEarth、Copernicus-FM 这类模型进一步把多源地球观测信号压缩成地理 embedding。这个方向很自然：卫星影像全球覆盖，能看到植被、水体、城市纹理、农田格局和季节变化。</p>]]></description></item><item><title>GeoFM 迁移评测：不要只看最后一层，decoder 也会改写排名</title><link>https://spacetop.win/2026/06/20260615_170003_twohour_remote_sensing_radar/</link><pubDate>Mon, 15 Jun 2026 17:00:03 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/20260615_170003_twohour_remote_sensing_radar/</guid><description><![CDATA[<h1 id="geofm-迁移评测不要只看最后一层decoder-也会改写排名" class="headerLink">
    <a href="#geofm-%e8%bf%81%e7%a7%bb%e8%af%84%e6%b5%8b%e4%b8%8d%e8%a6%81%e5%8f%aa%e7%9c%8b%e6%9c%80%e5%90%8e%e4%b8%80%e5%b1%82decoder-%e4%b9%9f%e4%bc%9a%e6%94%b9%e5%86%99%e6%8e%92%e5%90%8d" class="header-mark"></a>GeoFM 迁移评测：不要只看最后一层，decoder 也会改写排名</h1><p><strong>结论：这一轮最值得补进雷达的是 2026-06-11 提交到 arXiv 的 <em>How do Self-Supervised Remote Sensing Vision Models Transfer to Downstream Tasks?</em>。它不是再提出一个遥感基础模型，而是系统追问一个更容易被忽略的问题：GeoFM 到底把下游任务需要的信息放在了哪一层，评测时用最后一层 embedding、轻量 decoder、UPerNet 或 fine-tuning，会不会直接改变模型排名？论文比较 MoCo、MAE、DINO v1、Prithvi v1、CROMA 和 TerraMind，结论很直接：GeoFM 的“强弱”不是一个固定标签，而是任务、标签量、特征层、decoder 和微调策略共同作用的结果。</strong></p>
<p>我按 2026-06-15 17:00 +08 检索公开来源，并过滤 SAR、PolSAR、InSAR、radar-only、microwave-only 与 SAR-optical fusion 主线工作。本篇选择的是 GeoFM 迁移评测论文。虽然被比较的 CROMA 来自跨传感器预训练家族，论文的下游评测明确使用 optical/Sentinel-2 encoder；这里也只讨论光学/多光谱迁移、dense prediction 和评测协议，不把雷达分支作为主线。</p>
<p>它和前几轮的 Flexible GeoFM 不同。Flexible GeoFM 关心的是 band 配置、tokenization 和 missing-band 鲁棒性；本篇关心的是 <strong>同一个预训练模型被怎样读取和适配</strong>。换句话说，前者问“输入谱段不齐时架构怎么设计”，这篇问“模型内部哪一层才真正对下游有用，以及评测 head 有没有读对”。</p>
<h2 id="背景" class="headerLink">
    <a href="#%e8%83%8c%e6%99%af" class="header-mark"></a>背景</h2><p>遥感基础模型这两年很容易陷入一个简单叙事：更大的预训练数据、更复杂的多模态目标、更高的 benchmark 总分，似乎就代表更强的通用能力。但真实下游使用并不这么干净。</p>
<p>一个模型可能在 EuroSAT 这类图像级土地覆盖分类上很好，却在像素级分割里一般；另一个模型可能在低层回归任务上保留更多光谱和环境信息，却不擅长高层语义；还有一些模型在 10% 标签设置下有优势，但标签变多后优势消失。更麻烦的是，很多评测默认取最后一层 embedding 或套一个标准 UPerNet decoder，可 GeoFM 的信息未必集中在最后一层。</p>]]></description></item><item><title>过去 24 小时遥感 AI 雷达：GeoFM 比架构，VLM 比证据，Agent 比执行</title><link>https://spacetop.win/2026/06/20260615_090002_daily_remote_sensing_radar/</link><pubDate>Mon, 15 Jun 2026 09:00:02 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/20260615_090002_daily_remote_sensing_radar/</guid><description><![CDATA[<h1 id="过去-24-小时遥感-ai-雷达geofm-比架构vlm-比证据agent-比执行" class="headerLink">
    <a href="#%e8%bf%87%e5%8e%bb-24-%e5%b0%8f%e6%97%b6%e9%81%a5%e6%84%9f-ai-%e9%9b%b7%e8%be%begeofm-%e6%af%94%e6%9e%b6%e6%9e%84vlm-%e6%af%94%e8%af%81%e6%8d%aeagent-%e6%af%94%e6%89%a7%e8%a1%8c" class="header-mark"></a>过去 24 小时遥感 AI 雷达：GeoFM 比架构，VLM 比证据，Agent 比执行</h1><p><strong>结论：今天最值得看的不是单点 SOTA，而是遥感 AI 的评价对象正在变化。</strong> GeoFM 方向开始从“谁的预训练更大”转向“同一协议下，架构如何处理缺 band、多光谱和下游任务”；GeoAI Agent 方向开始从“能不能调用工具”转向“能不能把遥感影像、格网数据、GIS、模拟器和文档证据串成可执行过程”；CV-to-RS 方向给出一个强信号：box/mask prompt 与 test-time adaptation 很适合做遥感开放词汇分割和变化检测的证据校准。</p>
<p>我按 2026-06-15 09:00:02 +08:00 回看公开来源。由于 arXiv 周末没有正常新一轮发布，严格 24 小时内没有比前几轮更强的新遥感主线；本篇保留最近一个可核验 release 窗口里仍值得进入日报的 5 个条目，并过滤 SAR、PolSAR、InSAR、radar-only、microwave-only 和 SAR-optical fusion 主线。个别论文含 S1/S2 混合实验时，本文只讨论其 Sentinel-2、多光谱、缺 band 和架构泛化部分，不把 SAR 结果作为推荐依据。</p>
<h2 id="今日-5-个重点" class="headerLink">
    <a href="#%e4%bb%8a%e6%97%a5-5-%e4%b8%aa%e9%87%8d%e7%82%b9" class="header-mark"></a>今日 5 个重点</h2><table>
  <thead>
      <tr>
          <th>排名</th>
          <th>论文/项目</th>
          <th style="text-align: right">来源时间</th>
          <th>任务</th>
          <th>数据/模态</th>
          <th>贡献</th>
          <th>代码/数据</th>
          <th style="text-align: right">分数</th>
          <th>为什么重要</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>1</td>
          <td>Emerging Flexible Designs for Geospatial Multimodal Foundation Models</td>
          <td style="text-align: right">arXiv, 2026-06-10</td>
          <td>GeoFM 架构比较</td>
          <td>Sentinel-2、多光谱、GEOBench</td>
          <td>在同一预训练目标、数据和下游协议下比较 SatMAE、DOFA、Flex，重点看 band 灵活性和 dense prediction</td>
          <td>论文公开；复现实验框架指向 Terratorch iterate</td>
          <td style="text-align: right">8.5</td>
          <td>它把 GeoFM 讨论从“模型名对模型名”拉回到 tokenization、fusion、missing-band 这些可实验变量</td>
      </tr>
      <tr>
          <td>2</td>
          <td>TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?</td>
          <td style="text-align: right">arXiv, 2026-06-11</td>
          <td>Earth-system agent benchmark</td>
          <td>EO imagery、gridded data、GIS、simulation、documents</td>
          <td>403 个 agentic tasks、3 个 track、8 个应用域、24,500 个 verified execution steps</td>
          <td>论文公开；代码/benchmark 需继续跟踪入口</td>
          <td style="text-align: right">8.4</td>
          <td>遥感 AI 评测开始要求过程证据、工具参数和 artifact provenance，而不是只看最终文字</td>
      </tr>
      <tr>
          <td>3</td>
          <td>GeoNatureAgent Benchmark</td>
          <td style="text-align: right">arXiv, 2026-06-11</td>
          <td>环境地理分析 agent</td>
          <td>GIS API、环境指标、BigEarthNet V2 扩展</td>
          <td>93 个任务、18 类能力、16 个工具接口，评测真实 API 上的结构化 tool calling</td>
          <td>论文称 benchmark、harness、自托管 API 公开</td>
          <td style="text-align: right">8.0</td>
          <td>对生态、城市、农业场景很实用：检验 agent 是否真的会做地理分析，而不是会写漂亮解释</td>
      </tr>
      <tr>
          <td>4</td>
          <td>SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning</td>
          <td style="text-align: right">arXiv / project, 2026-06-11</td>
          <td>VLM 空间推理接口</td>
          <td>图像/视频、3D/4D 空间任务</td>
          <td>训练自由框架，让 VLM 在 stateful Python kernel 中逐步写代码、观察结果、再推理</td>
          <td>项目页公开；GitHub 需跟踪</td>
          <td style="text-align: right">7.8</td>
          <td>这条 CV 线可迁移到遥感：大幅 tile、mask、polygon、DEM、GIS layer 都适合可执行代码轨迹</td>
      </tr>
      <tr>
          <td>5</td>
          <td>MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models</td>
          <td style="text-align: right">arXiv / GitHub, 2026-06-11</td>
          <td>Mask prompt / object-centric prediction</td>
          <td>视频、mask、动作条件</td>
          <td>把 mask 同时作为输入 prompt 和预测目标，降低语言指代歧义并抑制背景噪声</td>
          <td>arXiv 与 GitHub README 可访问</td>
          <td style="text-align: right">7.5</td>
          <td>虽然是机器人论文，但对遥感 VLM/SAM 很有迁移价值：box/mask prompt 可以成为跨域 TTA 的空间锚点</td>
      </tr>
  </tbody>
</table>
<h2 id="1-flexible-geofm第一篇最值得精读" class="headerLink">
    <a href="#1-flexible-geofm%e7%ac%ac%e4%b8%80%e7%af%87%e6%9c%80%e5%80%bc%e5%be%97%e7%b2%be%e8%af%bb" class="header-mark"></a>1. Flexible GeoFM：第一篇最值得精读</h2><p><strong>这篇的价值在于把 GeoFM 的争论变成可控实验。</strong> 过去很多遥感 foundation model 论文同时换了数据、任务、训练轮数、mask 策略、输入 band 和 decoder，很难判断到底是架构有效，还是训练 recipe 更强。<code>Emerging Flexible Designs for Geospatial Multimodal Foundation Models</code> 把 SatMAE、DOFA 和一个 ClimaX-inspired Flex 放进同一套自监督预训练和 GEOBench 下游协议里比较，重点问两个问题：多光谱 band 应该怎么 tokenization，跨 band / modality 的 fusion 应该放在什么位置。</p>]]></description></item><item><title>Flexible GeoFM：缺 band 鲁棒性可能比单榜最高分更重要</title><link>https://spacetop.win/2026/06/20260612_210002_twohour_remote_sensing_radar/</link><pubDate>Fri, 12 Jun 2026 21:00:02 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/20260612_210002_twohour_remote_sensing_radar/</guid><description><![CDATA[<h1 id="flexible-geofm缺-band-鲁棒性可能比单榜最高分更重要" class="headerLink">
    <a href="#flexible-geofm%e7%bc%ba-band-%e9%b2%81%e6%a3%92%e6%80%a7%e5%8f%af%e8%83%bd%e6%af%94%e5%8d%95%e6%a6%9c%e6%9c%80%e9%ab%98%e5%88%86%e6%9b%b4%e9%87%8d%e8%a6%81" class="header-mark"></a>Flexible GeoFM：缺 band 鲁棒性可能比单榜最高分更重要</h1><p><strong>结论：这一轮最值得单独跟踪的不是一个新遥感 VLM，而是一篇把 geospatial foundation model 架构放到同一预训练、同一 GeoBench 协议下比较的工作；它提醒我们，真正可落地的遥感基础模型必须能在 band 缺失、传感器切换和任务谱段偏好变化时“优雅退化”。</strong></p>
<p>我按 2026-06-12 21:00 +08 检索公开来源，过滤了 SAR、PolSAR、InSAR、radar-only、microwave-only 和 SAR-optical fusion 方向。本篇选择 2026-06-10 提交的 <em>Emerging Flexible Designs for Geospatial Multimodal Foundation Models</em>。论文中包含一个 Sentinel-1/Sentinel-2 扩展实验，但本文只讨论其 Sentinel-2 光学多光谱主实验和缺 band 结论，不把 SAR-only 结果作为推荐重点。</p>
<p>这篇的价值在于它不再只问“哪个 GeoFM 在某个下游任务上最高”，而是问一个更工程也更科学的问题：当下游数据只有 RGB+NIR，或者缺少 Red Edge / SWIR，或者从 Sentinel-2 迁移到商业四波段影像时，模型性能如何下降。这个问题直接关系到遥感基础模型能不能从论文 benchmark 进入真实生产管线。</p>
<h2 id="背景" class="headerLink">
    <a href="#%e8%83%8c%e6%99%af" class="header-mark"></a>背景</h2><p>过去两年遥感基础模型的竞争很容易被三个指标带偏：模型参数量、预训练数据规模、单个 benchmark 的平均分。问题是，遥感应用的输入从来不稳定。不同卫星的光谱配置不同，同一地区可能因为云、传感器噪声、产品级别或采购成本导致某些 band 不可用；农业、城市、生态和灾害任务对谱段的依赖也不同。一个模型在完整 Sentinel-2 十波段上表现强，并不代表它在 RGB+NIR 或缺 SWIR 的场景里可靠。</p>
<p>这篇论文把 SatMAE、DOFA 和一个 ClimaX/Flex 风格架构放到同一实验条件下比较。作者统一了预训练目标、预训练数据、模型规模和 GeoBench 下游协议，尽量减少“每篇论文各自调参、各自选数据”的不可比问题。这个设定对后续做 GeoFM 很重要，因为很多所谓 SOTA 其实混杂了架构、数据、训练轮数、下游 head 和评测 split 的差异。</p>]]></description></item><item><title>RS-05 AlphaEarth/Prithvi Embeddings for Small-Area LoRA</title><link>https://spacetop.win/2026/06/rs-05-alphaearth-prithvi-embeddings-for-small-area-lora/</link><pubDate>Sun, 07 Jun 2026 09:04:00 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/rs-05-alphaearth-prithvi-embeddings-for-small-area-lora/</guid><description><![CDATA[<h1 id="rs-05-alphaearthprithvi-embeddings-for-small-area-lora" class="headerLink">
    <a href="#rs-05-alphaearthprithvi-embeddings-for-small-area-lora" class="header-mark"></a>RS-05 AlphaEarth/Prithvi Embeddings for Small-Area LoRA</h1><h2 id="结论摘要" class="headerLink">
    <a href="#%e7%bb%93%e8%ae%ba%e6%91%98%e8%a6%81" class="header-mark"></a>结论摘要</h2><p>这个方向最值得做的不是“再证明 foundation model 有用”，而是做一个严格、可复现、成本可控的比较：同样的小区域标签预算下，公开 embedding、冻结编码器、轻量 adapter/LoRA、decoder-only 和 full fine-tuning 到底谁更稳，尤其在跨区域、跨年份、跨生物群区、跨城市形态时谁掉得少。</p>
<p>关键边界：</p>
<ul>
<li>AlphaEarth Foundations 当前主要以 Google Satellite Embedding 数据集形式开放：10 m、年度、64 维、2017-2024 的全球 embedding layers，适合做 frozen embedding + classifier/head，不适合直接对模型本体做 LoRA。</li>
<li>Prithvi-EO-2.0、Clay、SatlasPretrain 是更适合做参数高效微调的 open model/backbone 路线。Prithvi-EO-2.0 官方 GitHub 已提供 TerraTorch 下游任务配置，TerraTorch 也明确支持 Prithvi、TerraMind、SatMAE、Satlas、DOFA、Clay 等 backbone。</li>
<li>小区域制图的核心问题是“局部标签少 + 空间自相关强 + 区域外泛化难”。随机划分会虚高；必须做 spatial block、leave-region、leave-year、leave-biome 或 leave-city 测试。</li>
</ul>
<h2 id="问题由来" class="headerLink">
    <a href="#%e9%97%ae%e9%a2%98%e7%94%b1%e6%9d%a5" class="header-mark"></a>问题由来</h2><p>传统遥感制图依赖人工特征、光谱指数、随机森林或任务专用深度网络。它们在本地标签足够、同分布测试时表现不错，但迁移到新的城市、农田制度、火烧迹地、气候带或传感器组合时往往需要重新标注。GeoFM 的承诺是：用大规模未标注 EO 数据预训练出通用表示，再用很少的本地标签快速制图。</p>
<p>2024-2026 出现了两条明显路线：</p>
<ol>
<li><strong>Embedding-as-data</strong>：AlphaEarth 把多源 EO 信息压成年度 embedding field。用户在 Earth Engine 或 GCS 中读取 64 维 embedding，再训练线性模型、树模型、MLP 或轻量空间头。</li>
<li><strong>Open-backbone fine-tuning</strong>：Prithvi、Clay、SatlasPretrain 等提供模型权重和代码，用户可以做 frozen linear probe、decoder-only、adapter、LoRA 或 full fine-tuning。</li>
</ol>
<p>这两条路线目前缺一个公平实验：在同样标签预算、同样 spatial split、同样任务指标下比较“公开 embedding + 轻量 head”和“可微调 backbone + LoRA/adapter”。</p>]]></description></item><item><title>RS-04 Geo-Temporal Embedding for Foundation Models</title><link>https://spacetop.win/2026/06/rs-04-geo-temporal-embedding-for-foundation-models/</link><pubDate>Sun, 07 Jun 2026 09:03:00 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/rs-04-geo-temporal-embedding-for-foundation-models/</guid><description><![CDATA[<h1 id="rs-04-geo-temporal-embedding-for-foundation-models" class="headerLink">
    <a href="#rs-04-geo-temporal-embedding-for-foundation-models" class="header-mark"></a>RS-04 Geo-Temporal Embedding for Foundation Models</h1><h2 id="1-执行摘要" class="headerLink">
    <a href="#1-%e6%89%a7%e8%a1%8c%e6%91%98%e8%a6%81" class="header-mark"></a>1. 执行摘要</h2><p>2024-2026 的 GeoFM 正在从“只看像素”转向“像素 + 传感器 + 时间 + 地理位置 + 生态/气候上下文”的条件化表示。这个方向的关键不只是把经纬度和日期塞给模型，而是要回答：模型是否学到了可迁移的地理时间规律，还是只是记住某个地方常见什么地物。</p>
<p>目前可以把方法分成五类：</p>
<table>
  <thead>
      <tr>
          <th>类别</th>
          <th>做法</th>
          <th>代表</th>
          <th>优点</th>
          <th>风险</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>显式连续元数据 embedding</td>
          <td>对 lat/lon、week/hour、GSD、wavelength 做数值归一化后编码</td>
          <td>Clay, Prithvi-EO-2.0</td>
          <td>工程直接、适合下游 adapter</td>
          <td>容易让模型记地理偏置</td>
      </tr>
      <tr>
          <td>离散 token 化</td>
          <td>将经纬度/时间/模态等转成离散 token，与图像 token 一起预训练</td>
          <td>TerraMind</td>
          <td>适合任意模态生成和 token-level 推理</td>
          <td>token 粒度影响很大，坐标离散会损失连续空间关系</td>
      </tr>
      <tr>
          <td>时空统一检索空间</td>
          <td>把图像、位置、时间映射到同一 embedding space</td>
          <td>TIGeR, GT-Loc</td>
          <td>可做 geolocation、time prediction、geo-time retrieval</td>
          <td>主要来自自然图像/街景，迁移到卫星需处理俯视和传感器差异</td>
      </tr>
      <tr>
          <td>年度/时序 embedding field</td>
          <td>生成每年每个像元的地表 embedding</td>
          <td>AlphaEarth Foundations, Tessera</td>
          <td>适合全球制图和时间序列监测</td>
          <td>模型内部不可控，可能隐藏空间不公平性</td>
      </tr>
      <tr>
          <td>采样/benchmark 层面的地理时间控制</td>
          <td>用 spatial/temporal split、生态区覆盖、跨年评测控制偏差</td>
          <td>EarthShift, PANGAEA, SSL4EO-S12 v1.1</td>
          <td>可验证泛化</td>
          <td>不是模型结构，不能单独提升能力</td>
      </tr>
  </tbody>
</table>
<p>核心研究机会：提出一个 <strong>Geo-Time Conditional Adapter (GTCA)</strong>，在冻结 GeoFM backbone 的前提下，只用轻量模块注入经纬度、年内时间、年份、气候区和 GSD，并通过反偏置训练约束避免“坐标捷径”。</p>]]></description></item><item><title>RS-03 GSD-Aware GeoFM Adapter</title><link>https://spacetop.win/2026/06/rs-03-gsd-aware-geofm-adapter/</link><pubDate>Sun, 07 Jun 2026 09:02:00 +0800</pubDate><author><name>WangTong</name></author><guid>https://spacetop.win/2026/06/rs-03-gsd-aware-geofm-adapter/</guid><description><![CDATA[<h1 id="rs-03-gsd-aware-geofm-adapter" class="headerLink">
    <a href="#rs-03-gsd-aware-geofm-adapter" class="header-mark"></a>RS-03 GSD-Aware GeoFM Adapter</h1><p>目标：研究遥感 foundation model 如何显式利用 GSD/分辨率作为连续条件；比较 ScaleEarth、SkySense、Prithvi-EO-2.0、AlphaEarth、GeoFM/AnySat/Clay/Galileo 中的尺度处理方式；设计一个只引入轻量 adapter/LoRA 的 GSD-aware 下游适配方法，并给出分类、分割、检测三个任务的实验矩阵。</p>
<h2 id="1-问题由来" class="headerLink">
    <a href="#1-%e9%97%ae%e9%a2%98%e7%94%b1%e6%9d%a5" class="header-mark"></a>1. 问题由来</h2><p>GSD, ground sample distance，决定一个像素对应地面的真实长度。遥感模型如果只看 resize 后的 patch，很容易把“像素尺度”误当成“真实尺度”：同样 224 x 224 的输入，在 0.3 m 航空影像中可能覆盖一个街区，在 10 m Sentinel-2 中可能覆盖数平方公里。自然图像 VFM 常把尺度变化当成数据增强问题，但遥感中尺度本身包含任务语义：</p>
<ul>
<li>建筑、车辆、飞机、船舶等目标的真实尺寸范围相对稳定，GSD 决定它们在图像中的像素大小。</li>
<li>land cover / crop / ecological mapping 中，GSD 影响 mixed pixel、边界模糊、纹理可见性和类别层级。</li>
<li>多源训练常把 Sentinel-2、Landsat、NAIP、VHR aerial、Planet、commercial imagery 放在一起，如果模型不知道 GSD，跨传感器泛化会出现隐性偏差。</li>
<li>下游 benchmark 常把图像统一 resize 到固定输入大小，这会抹掉真实地理尺度，导致模型在跨分辨率测试时不稳。</li>
</ul>
<p>因此，GSD-aware adapter 的核心不是“把分辨率写进 prompt”，而是让模型在特征变换、attention、adapter/LoRA 参数或 decoder 中连续地感知地面尺度。</p>
<h2 id="2-代表工作与尺度处理方式" class="headerLink">
    <a href="#2-%e4%bb%a3%e8%a1%a8%e5%b7%a5%e4%bd%9c%e4%b8%8e%e5%b0%ba%e5%ba%a6%e5%a4%84%e7%90%86%e6%96%b9%e5%bc%8f" class="header-mark"></a>2. 代表工作与尺度处理方式</h2><table>
  <thead>
      <tr>
          <th>工作</th>
          <th style="text-align: right">年份/来源</th>
          <th>链接</th>
          <th>官方代码/模型</th>
          <th>尺度/GSD 处理</th>
          <th>对 RS-03 的启发</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>ScaleEarth</td>
          <td style="text-align: right">2026 arXiv</td>
          <td><a href="https://arxiv.org/abs/2605.07562" target="_blank" rel="noopener noreferrer">arXiv</a></td>
          <td>公开检索未确认官方代码</td>
          <td>将 GSD 作为连续尺度条件，用 Hyper-LoRA 动态生成/调节 VLM 参数，并构建 GeoScale-VQA 来测尺度理解</td>
          <td>直接证明“连续 GSD 条件 + LoRA”是可行题眼；可从 VLM 扩到分类/分割/检测</td>
      </tr>
      <tr>
          <td>SkySense</td>
          <td style="text-align: right">2024 CVPR</td>
          <td><a href="https://openaccess.thecvf.com/content/CVPR2024/html/Guo_SkySense_A_Multi-Modal_Remote_Sensing_Foundation_Model_Towards_Universal_Interpretation_CVPR_2024_paper.html" target="_blank" rel="noopener noreferrer">CVF</a></td>
          <td><a href="https://github.com/Jack-bo1220/SkySense" target="_blank" rel="noopener noreferrer">GitHub</a></td>
          <td>多模态、多时相、大规模预训练，覆盖不同遥感源；主要通过数据规模和任务头吸收尺度差异</td>
          <td>强基线，但尺度是隐式学习；适合做 frozen backbone + GSD adapter 对照</td>
      </tr>
      <tr>
          <td>SkySense V2</td>
          <td style="text-align: right">2025 ICCV/arXiv</td>
          <td><a href="https://arxiv.org/abs/2412.10115" target="_blank" rel="noopener noreferrer">arXiv</a></td>
          <td><a href="https://github.com/Jack-bo1220/SkySense" target="_blank" rel="noopener noreferrer">GitHub org</a></td>
          <td>多模态统一模型；面向多任务、多传感器，多分辨率问题更多通过统一表征处理</td>
          <td>可作为多源 GeoFM 基线，检查显式 GSD 条件是否还能带来收益</td>
      </tr>
      <tr>
          <td>Prithvi-EO-2.0</td>
          <td style="text-align: right">2024 arXiv / IBM-NASA</td>
          <td><a href="https://arxiv.org/abs/2412.02732" target="_blank" rel="noopener noreferrer">arXiv</a></td>
          <td><a href="https://github.com/NASA-IMPACT/Prithvi-EO-2.0" target="_blank" rel="noopener noreferrer">GitHub</a>, <a href="https://huggingface.co/ibm-nasa-geospatial" target="_blank" rel="noopener noreferrer">Hugging Face</a></td>
          <td>基于 HLS/Sentinel-Landsat 系列，多时相 30 m 级数据；包含时间/位置相关设计，但训练尺度相对集中</td>
          <td>适合作为 30 m 多时相基座，测试 adapter 是否能迁移到 10 m/1 m/VHR</td>
      </tr>
      <tr>
          <td>AlphaEarth Foundations</td>
          <td style="text-align: right">2025 Google/DeepMind</td>
          <td><a href="https://research.google/blog/alphaearth-foundations-helps-map-our-planet-in-unprecedented-detail/" target="_blank" rel="noopener noreferrer">Google Research</a>, <a href="https://www.nature.com/articles/s41586-025-09260-x" target="_blank" rel="noopener noreferrer">Nature</a></td>
          <td><a href="https://developers.google.com/earth-engine/datasets/catalog/GOOGLE_SATELLITE_EMBEDDING_V1_ANNUAL" target="_blank" rel="noopener noreferrer">Earth Engine dataset</a></td>
          <td>生成年度 10 m 卫星 embedding field；尺度固定在产品网格，但融合多源信息</td>
          <td>不是常规可微调开源 backbone；更适合作为 10 m embedding baseline 或 teacher</td>
      </tr>
      <tr>
          <td>AnySat</td>
          <td style="text-align: right">2025 CVPR Highlight</td>
          <td><a href="https://openaccess.thecvf.com/content/CVPR2025/html/Astruc_AnySat_One_Earth_Observation_Model_for_Many_Resolutions_Scales_and_CVPR_2025_paper.html" target="_blank" rel="noopener noreferrer">CVF</a></td>
          <td><a href="https://github.com/gastruc/AnySat" target="_blank" rel="noopener noreferrer">GitHub</a></td>
          <td>明确面向 many resolutions, scales, modalities；使用 scale-adaptive encoder/JEPA 类训练</td>
          <td>很适合对照“结构内建多尺度”与“外接轻量 GSD adapter”</td>
      </tr>
      <tr>
          <td>Clay v1.5</td>
          <td style="text-align: right">2024-2025 open model</td>
          <td><a href="https://clay-foundation.github.io/model/release-notes/specification.html" target="_blank" rel="noopener noreferrer">docs</a></td>
          <td><a href="https://github.com/Clay-foundation/model" target="_blank" rel="noopener noreferrer">GitHub</a></td>
          <td>支持多传感器、任意尺寸和多波段输入，工程接口通常保留 metadata</td>
          <td>适合作为工程可复现实验基线，测试 metadata-driven adapter</td>
      </tr>
      <tr>
          <td>Galileo</td>
          <td style="text-align: right">2025</td>
          <td><a href="https://github.com/nasaharvest/galileo" target="_blank" rel="noopener noreferrer">GitHub</a></td>
          <td><a href="https://github.com/nasaharvest/galileo" target="_blank" rel="noopener noreferrer">GitHub</a></td>
          <td>多模态 EO 表征，关注不同遥感模态和局部/全局特征</td>
          <td>可以作为多任务、多源基线；尺度条件需要查具体输入 metadata</td>
      </tr>
      <tr>
          <td>PANGAEA</td>
          <td style="text-align: right">2024-2025 benchmark</td>
          <td><a href="https://pangaea-bench.github.io/" target="_blank" rel="noopener noreferrer">Project</a>, <a href="https://github.com/yurujaja/pangaea-bench" target="_blank" rel="noopener noreferrer">GitHub</a></td>
          <td><a href="https://github.com/yurujaja/pangaea-bench" target="_blank" rel="noopener noreferrer">GitHub</a></td>
          <td>覆盖多任务、多区域、多分辨率/模态，是比较 GeoFM 的好平台</td>
          <td>适合作为统一 benchmark 框架，避免只在单一 GSD 数据集上过拟合</td>
      </tr>
      <tr>
          <td>EarthShift</td>
          <td style="text-align: right">2026 arXiv</td>
          <td><a href="https://arxiv.org/abs/2605.29330" target="_blank" rel="noopener noreferrer">arXiv</a>, <a href="https://earthshift.github.io/" target="_blank" rel="noopener noreferrer">Project</a></td>
          <td>项目页</td>
          <td>真实世界 distribution shift benchmark，包含空间/时间/尺度/传感器偏移</td>
          <td>可作为跨 GSD/跨传感器 robustness 验证的补充</td>
      </tr>
  </tbody>
</table>
<h2 id="3-方法脉络" class="headerLink">
    <a href="#3-%e6%96%b9%e6%b3%95%e8%84%89%e7%bb%9c" class="header-mark"></a>3. 方法脉络</h2><h3 id="31-隐式尺度学习" class="headerLink">
    <a href="#31-%e9%9a%90%e5%bc%8f%e5%b0%ba%e5%ba%a6%e5%ad%a6%e4%b9%a0" class="header-mark"></a>3.1 隐式尺度学习</h3><p>SkySense、Prithvi、Clay、Galileo 等主要依赖大规模多源预训练，让模型从数据中隐式吸收尺度差异。这类方法优点是简单，缺点是模型可能把传感器、地域、类别和 GSD 纠缠起来。例如 10 m Sentinel-2 中“城市纹理”与 0.3 m NAIP 中“建筑轮廓”不是同一层级语义，统一 resize 后模型容易学到 dataset shortcut。</p>]]></description></item></channel></rss>