Source-linked AI summary

Token-Oriented Semantic Communication with Pretrained Vision Transformers

Jiwoong Im, Minwoo Kim, Jaeho Lee, Yo-Seb Jeon, Yongjune Kim

arXiv:2608.25410v1eess.SPcs.AIcs.CVcs.LG

TL;DR

直接传输 transformer token 成本高且依赖具体模型,限制了协同推理中的 token 级语义通信。本文改为选择与 token 对齐的压缩图像 latent,在 1.24 bpp 下达到 85.83 % accuracy,相较传统 codec 和既有 LIC framework 实现了更优的 rate–accuracy 权衡。

  • 问题

    直接传输 transformer token embedding 会带来高昂的通信开销,并且不同模型的 embedding space 之间互操作性有限。

  • 方法

    一种模块化 framework 利用 token relevance 选择空间对齐的 LIC latent,通过 layer-selective attention rollout 估计相关性,并使用一个可学习的 surrogate token 适配冻结的 server。

  • 结果

    在 1.24 bpp 下达到 85.83 % accuracy,相较 WebP、BPG 和 task-agnostic LIC framework 实现了更优的 rate–accuracy 权衡。

  • 要点与局限

    token relevance 引导的 latent 选择支持 token 粒度的语义通信,无需直接传输 token embedding。

Abstract

from arXiv · show

Token communications realize the semantic communication principle at the granularity of transformer tokens, providing a promising direction for client--server collaborative inference in resource-constrained edge systems. However, directly transmitting token embeddings presents two practical challenges: substantial communication cost and limited interoperability across model-specific token embedding spaces. To address these challenges, we propose a \emph{token-oriented} semantic communication framework. In this framework, token-level task relevance determines which compressed image latents are transmitted, enabling token-granular transmission without directly transmitting token embeddings. The framework is modular, coordinating three pretrained components---a lightweight client-side vision transformer (ViT), a learned image compression (LIC) model, and a large server-side ViT---without end-to-end training. The key enabler is the one-to-one spatial alignment between ViT patch tokens and the LIC latent vectors, which allows token-level task relevance to directly determine which latent vectors are transmitted. Building on this alignment, token-aligned LIC selectively transmits task-relevant latents, layer-selective attention rollout estimates token relevance from a selected range of attention layers in a single forward pass, and surrogate token substitution adapts the frozen server model by optimizing a single learnable token. Experiments on ImageNet show that the proposed framework achieves a more favorable rate--accuracy trade-off than recent semantic communication schemes, hand-crafted codecs, and task-agnostic LIC models.

I. 引言 · II. 相关工作

本文提出面向图像分类的 token-oriented semantic communication,利用 token relevance 选择对齐的 LIC latent,而非传输模型特定的 token embedding。其模块化框架结合 client ViT、learned image compressor 与 server ViT,并引入 token-aligned LIC、layer-selective attention rollout 和 learnable surrogate token substitution。

  • I. 引言: 面向 token-level 的 semantic communication 关注下游任务相关性,但直接传输高维 token embedding 会带来 substantial cost,并且独立训练的模型之间存在 limited interoperability。由于 transformer 将各模态输入处理为 token 序列 [1]–[6],token 被视为自然的通信单元;而 semantic communication 优先传输与任务相关的信息
  • I. 引言: 所提出的框架选择与任务相关的 image latent,而非传输 token embedding,利用 ViT patch token 与 LIC latent vector 之间的一对一空间对齐 [2], 当 ViT patch size 等于 LIC encoder 的 spatial downsampling factor 时即可形成这种对齐,使 token relevance 能够索引待传输的 latent,而无需修改 LIC architecture 或增加训练。
  • I. 引言: 该框架具有模块化特点,协调分别预训练的轻量级 client-side ViT、LIC compressor 和大型 server-side ViT 模型,实现协同推理。客户端估计 visual-token relevance,compressor 据此选择 latent representation,传输则发生在压缩之后。
  • II. 相关工作: 与传输原始或标量量化 image patch 的既有 token-oriented scheme 相比,该框架在 LIC latent domain 中运行,从而改善 rate–accuracy trade-off。这些既有方法利用 token-level relevance,但不直接传输 token embedding,而是在 pixel domain 中传输 representation。
  • I. 引言: Token-aligned LIC 直接索引任务相关空间位置处的 latent,在保留任务相关视觉信息的同时降低 transmission rate。该组件利用 ViT visual token 与 LIC latent representation 之间共享的 spatial grid。
  • I. 引言: Layer-selective attention rollout 通过聚合选定 transformer layer 的 attention 来估计 token relevance,相较于 last-layer attention 、all-layer rollout 和 gradient-weighted attention ,性能更优。该方法旨在提供更准确的 relevance estimate,同时仅需执行一次 client-side ViT forward process。
  • I. 引言: Learnable surrogate token substitution 用一个经过优化的 token 替换未选中的视觉区域,在无需重新训练大型 backbone 的情况下提升 server inference。使用 reconstructed image 或 selected patch 进行未经适配的推理会降低 classification accuracy,而重新训练 server model 成本高昂,并会改变其处理完整输入时的行为。

A. Token级语义通信 · B. 学习式图像压缩 · C. 注意力引导的重要性估计

论文将面向token的通信与基于VQ的token传输进行对比,建立在学习式图像压缩之上,并回顾基于注意力的token相关性估计方法。这些基础为在token粒度运行、同时避免传输模型特定token embedding的通信方案提供了动机。

  • A. Token级语义通信: 基于VQ的token通信将token表示作为向量量化码本索引传输,并要求端到端联合训练,以使发送端与接收端共享码本
  • B. 学习式图像压缩: LIC取得了可与传统手工设计图像压缩相竞争的率失真性能,本文建立在非线性变换编码和超先验架构之上
  • B. 学习式图像压缩: LIC流程将图像编码为潜在表示,对其进行量化,再将量化后的潜变量解码为重建图像。编码器生成 Xc ∈ R^(N×Dc),量化得到 X̂c,解码器重建图像。
  • B. 学习式图像压缩: 超先验网络通过传输用于估计量化潜变量条件分布的量化侧信息,减少剩余的空间冗余。后续扩展方法联合预测潜变量均值 µ 和方差 σ
  • C. 注意力引导的重要性估计: ViT将图像重塑为展平图像块,通过线性投影将其映射为视觉token,前置一个class token,并加入可学习的位置嵌入 所得视觉token矩阵为每个图像块包含一个token。
  • C. 注意力引导的重要性估计: 由于self-attention调节token交互,注意力权重可以在下游推理过程中估计全局token依赖关系和token级任务相关性。相关性由 R ∈ R^((N+1)×(N+1)) 和视觉token相关性分布 r̄ ∈ R^N 表示。
  • C. 注意力引导的重要性估计: 末层注意力使用最终层权重,因其简单性而常见于面向token的通信研究 ;注意力rollout则聚合所有层的权重 rollout通过单位矩阵纳入残差连接。
  • C. 注意力引导的重要性估计: 梯度加权注意力利用top-1 logit梯度对rollout重新加权,能够精确估计任务相关性,但梯度计算限制了其在资源受限客户端上的部署

D. 可学习输入 token

该框架采用 surrogate token substitution,以单个可学习 token 替换缺失的输入 token,同时适配冻结的预训练 vision transformer。这一设计结合了 visual prompt tuning 的参数高效适配机制与 masked image modeling 的共享 mask token 概念,,

  • D. 可学习输入 token: Surrogate token substitution 使用单个可学习 token 替换冻结 server model 中缺失的输入 token。该方法将可训练的插入向量与冻结 backbone 的适配相结合。
  • D. 可学习输入 token: Visual prompt tuning 通过在 vision transformer 前置少量可学习 prompt token 来进行适配,仅优化这些 token 并冻结 backbone 这为所提出的 surrogate token 提供了参数高效适配原则。
  • D. 可学习输入 token: Masked image modeling 在被 mask 的位置使用一个共享 mask token,并与 backbone 联合优化,以进行自监督重建, 所提出的方法采用单 token 替换思想,但不包含上述联合预训练过程。

III. 所提框架概述

该框架支持轻量级客户端 ViT 与压缩器同大型服务器 ViT 及解压器之间的协同推理。客户端估计 token 相关性,选择 token 进行 LIC 传输;服务器通过 surrogate token substitution 重建输入并完成最终分类。

  • 框架概述: 轻量级客户端 ViT 和神经压缩器与大型服务器 ViT 和神经解压器协同,实现客户端—服务器推理。客户端可采用 DeiT-Tiny ,服务器可采用 DeiT-III-Large
  • 框架概述: 客户端计算 token-level task relevance,将其阈值化为二值选择图 s ∈{0, 1}^N,并生成压缩比特流。选择图中的每个元素分别对应 N 个视觉 token 之一。
  • 框架概述: 接收压缩数据和选择图后,服务器通过 surrogate token substitution 构造服务器 token 输入,并返回最终分类结果。Algorithm 1 将所得预测记为 y。
  • 框架概述: LIC 仅保留任务相关 token 位置处的 latent representations,并根据选定 token 的数量减少 latent payload。传输的比特流还包括 hyperpriors 和选择图;与视觉 latent representations 所需的比特数相比,它们占用的比特数很小。

IV. 主要技术组件 · A. Token-Aligned Learned Image Compression · 1) 选择性潜变量传输:

该框架将 token 对齐的 learned image compression 与基于相关性的选择性潜变量传输相结合。ViT tokens 与 LIC latents 之间的结构对齐,使任务相关的 latent vectors 得以直接传输;同时,hyperprior prediction 支持对省略位置进行重建。

  • IV. 主要技术组件: 客户端首先通过 layer-selective attention rollout 估计 token relevance,选择 tokens,并仅保留其对应的 LIC latent positions 以生成 bitstream。在服务器端,由于对应的 latents 未被传输,未选位置的重建 patches 不可靠。
  • A. Token-Aligned Learned Image Compression: Token-aligned LIC 传输任务相关的 latent representations,而不是独立编码的 image patches,从而保留 learned compression 利用统计冗余的能力。直接 patch transmission 和 importance-aware scalar quantization, 对 patches 进行独立编码,而所提方法在 LIC latent domain 中运行。
  • A. Token-Aligned Learned Image Compression: ViT patch tokens 与 LIC latent vectors 之间的一对一空间对齐,使 token-selection map 能够直接索引传输的 latents,而无需修改 LIC architecture。两个模型通常都按 P = 16 降低分辨率,因此具有相同数量的空间位置;ViT 使用 16 × 16 patches,, ,而 LIC 使用四个 stride-2 convolutional stages
  • A. Token-Aligned Learned Image Compression: Tokens 按 relevance 降序选择,直到 cumulative relevance 超过 threshold δ,因此 selected-token count 会随 image content 变化,例如 object size 和 inference difficulty。selection map s ∈ {0, 1}^N 用 s_i = 1 标记 selected tokens,并定义 selected 和 unselected spatial sets。
  • 1) 选择性潜变量传输:: 基于 Hyperprior 的 entropy modeling 使每个 selected latent element 都能利用其自身预测的 mean 和 scale 进行编码与解码,而无需访问其他 latent elements。预测参数由 quantized hyperprior bZ, 获得。
  • 1) 选择性潜变量传输:: 在服务器端,先用 hyperprior-predicted means 填补省略的 latent positions,再通过 neural-decoder 进行 image reconstruction。这种替换避免了重建过程中缺失的 latent positions 保持未定义状态。
  • 1) 选择性潜变量传输:: 仅对 selected positions 的 latent vectors 进行 entropy coding,而未选位置跳过编码,从而降低 communication cost。encoder 处理 i ∈ S 的位置,省略 i ∈ U 的位置,并按 ascending spatial index 对传输的 selected vectors 排序。

2) 通信效率的理论分析:

在理想熵编码假设下,本文分析了选择性潜变量传输相对于传输完整潜变量表示的通信开销。该界表明,码率约随选择比例线性降低,但会受到旁信息开销和信息密度不均衡的影响。

  • 2) 通信效率的理论分析:: 该分析假设存在理想熵编码器,其对每个符号的编码长度趋近于该符号的自信息量,并利用 hyperprior 和选择映射定义开销。该界使用选中和未选中潜变量位置的平均自信息量。
  • 2) 通信效率的理论分析:: 选择性传输发送保留的潜变量,以及量化 hyperprior 和二值选择映射旁信息;而完整传输则编码完整的潜变量矩阵及其相关开销。实际传输比特数为 S + B_bZ + B_s,其中 B_s 表示选择映射比特数。
  • 2) 通信效率的理论分析:: 当选中区域和未选中区域具有相近的信息密度时,码率降低幅度与选择比例 ρ 近似呈线性关系,但会受到旁信息开销 η 的抵消。该情形对应于 k ≈ 1。
  • 2) 通信效率的理论分析:: 当未选中区域相对于选中区域信息稀疏时,该界预测码率降低呈次线性;当未选中区域信息密集时,则呈超线性。这两种情形分别对应 k < 1 和 k > 1。

3) 预测均值填补:

预测均值填补在 latent 解码前,使用接收的 hyperprior 得到的条件均值估计替换未选中的 latent 位置。该方法几乎不增加计算开销,并能改善重建效果,同时无需将重建后的未选中 patch 转发给 server predictor。

  • 预测均值填补: 在 latent 解码前,使用由接收的 hyperprior 推导出的预测均值填补未选中的 latent 位置。预测均值是给定 hyperprior 上下文时局部 latent feature 的条件期望,为缺失 latent 提供了有理论依据的替代值。
  • 预测均值填补: 由于 hyper decoder 已经为熵解码生成 bµ,预测均值填补几乎不会引入额外计算开销。填补后的表示利用接收的选择指示保留选中的 latent,并在未选中位置替换为预测均值。
  • 预测均值填补: 预测均值填补改善了选中图像 patch 的重建效果,同时重建后的未选中 patch 不会转发给 server-side predictor。该填补仅用于改善重建,不会导致将未选中的重建 patch 传输用于预测。

B. 层选择注意力展开 · C. 代理 token 替换

该框架通过层选择注意力展开估计 token 相关性,并利用单个可学习的代理 token,使冻结的 server ViT 适应不完整输入。两种机制协同提升相关性估计的准确性,保持分类准确率,并降低对 latent 擦除的敏感性。

  • B. 层选择注意力展开: 层选择注意力展开聚合选定 ViT 层的注意力,因为早期层噪声较大,中间层聚焦于目标,而最终层逐渐偏向背景。这种依赖层的行为解释了为什么最后一层注意力会高估背景相关性,以及为什么完整注意力展开可能无法将定位结果准确转化为相关性估计,,.
  • B. 层选择注意力展开: 对于 DeiT-Tiny,该方法使用 layers 7–12,保留最终层,同时排除噪声较大的早期层,并生成以主要目标为中心的相关性图。选定范围由 Section V-F 中的层范围研究确定,最终层直接影响分类头使用的 class token.
  • B. 层选择注意力展开: 层选择注意力展开比最后一层注意力和注意力展开更准确地估计任务相关性,在主要工作区间内达到或超过 gradient-weighted attention 在主要 client 配置下,该方法仅需 single forward pass 即可实现这一点;而 gradient-weighted attention 需要 backward computation 和存储的 activations。
  • C. 代理 token 替换: 代理 token 替换未选中的重建图像 patch,使冻结的 server 学会将缺失信息视为不存在,而不是误导性的视觉证据。重建图像保留空间分辨率,但未选中的 patch 仅包含由 coarse hyperprior 预测的内容;在 backbone 冻结的情况下,代理 token 针对下游分类进行优化。
  • C. 代理 token 替换: 代理 token 替换在未经适配的部分输入推理与重新训练整个 server ViT 之间提供了折中方案,同时在完整输入上保持原始预测器不变。Direct-reconstruction 和 selected-patch 基线均未对冻结预测器进行适配,而完整重新训练会带来显著更高的适配成本。
  • C. 代理 token 替换: 与无适配推理相比,代理 token 替换能更有效地保持下游准确率,同时仅通过一个可学习向量适配冻结的 server 预测器。对于 DeiT-III-Large,适配成本为 D = 1024 parameters,且完整输入行为与预训练 backbone 保持一致。
  • C. 代理 token 替换: 当信道损伤擦除已传输的 latents 时,server 使用代理 token 替换受影响的 token 位置,以降低其对分类准确率的影响。该鲁棒性收益在 Section V-C 的 packet-erasure channel 上进行评估。

V. 实验结果 · A. 实验设置

该框架在 ImageNet 分类任务上进行评估,并与已有语义通信方法、编解码器和 LIC 系统比较率–准确率权衡,同时考察信道鲁棒性和熵感知传输。实验采用轻量级 DeiT-Tiny 客户端与规模大得多的 DeiT-III-Large 服务器,并实现 token 对齐的 LIC 与冻结骨干网络的 surrogate token 训练。

  • V. 实验结果: ImageNet 实验评估了相较于面向 token 的语义通信基线、手工设计编解码器和 LIC 框架的率–准确率权衡,以及分组丢失鲁棒性和熵感知传输。这些评估分布在 Section V-B–V-D。
  • A. 实验设置: 系统在客户端部署 DeiT-Tiny ,在服务器部署 DeiT-III-Large ,以体现两端在内存和计算资源上的不均衡。根据 Table II,服务器模型的准确率达到 86.8%,而客户端模型为 72.2%。
  • A. 实验设置: DeiT-III-Large 服务器的准确率显著高于 DeiT-Tiny,但所需内存约大 50×。该段将这种差异视为资源约束不均衡条件下开展客户端–服务器协作的动机。
  • A. 实验设置: 针对每个 λ,分别训练一个独立的 hyperprior LIC 模型, ,其 latent 和 hyperprior 的通道维度分别为 192 和 128。LIC 模型针对 ImageNet 图像重建进行训练,其余优化设置遵循,
  • A. 实验设置: Surrogate token 训练在冻结预训练客户端和服务器骨干网络的同时,针对分类任务优化一个 token xsur ∈R1×D。训练通过 δsur 下的 layer-selective attention rollout、采用 λsur 的 LIC 压缩,以及替换服务器未选位置,模拟任务相关选择。
  • A. 实验设置: 每张图像的 selection map 使用 N = 196 bits,其开销小于 0.004 bpp,因此不计入总体比特率。该 map 使服务器能够识别由 surrogate token 替换的位置,并在重建图像时使用这些信息。

B. 率–准确率权衡 · C. 擦除信道上的分类准确率

与面向 token 的方法、手工设计的编解码器和任务无关的 LIC 模型相比,所提出的框架实现了更优的率–准确率权衡;同时,通过 surrogate token substitution 评估其在分组擦除信道上的鲁棒性。擦除信道评估将熵编码表示分组,并在受控码率下比较三种服务器端推理策略。

  • B. 率–准确率权衡: 通过将 token-selection threshold δ 从 0.5 调整至 0.98、将 LIC rate parameter λ 从 0.0075 调整至 2,得到率–准确率曲线。通常,任一参数取值增大都会提高比特率和下游性能,而其余组件保持不变。
  • B. 率–准确率权衡: 在可比比特率下,所提出的框架比 selected-patch transmission 和 importance-aware quantization 实现了更高的下游准确率。这些面向 token 的基线方法同样利用任务相关性,但在像素域中进行传输,因此所报告的增益主要归因于 token-aligned LIC 的码率效率。
  • B. 率–准确率权衡: 在 1.24 bpp 下达到 85.83% 准确率,仅比 86.81% 的无损服务器准确率低 0.98 个百分点;而 WebP 和 BPG 分别需要约 1.57 和 1.82 bpp 才能达到相同准确率。所有基线均使用相同的预训练 DeiT-III-Large 服务器模型进行比较;图中将 86.81% 报告为 24 bpp 下的无损上限。
  • B. 率–准确率权衡: 在低于 2.5 bpp 时,所提出的框架在可比比特率下比任务无关的 LIC 框架 实现了更高准确率。由于选择性传输与 ELIC 等自回归上下文模型并不直接兼容,实现采用了更简单的 mean-scale hyperprior。
  • C. 擦除信道上的分类准确率: 擦除信道实验分别对 latent representations 和 hyperpriors 进行分组,以定位分组丢失;否则,分组丢失可能破坏算术解码同步。hyperpriors 被置于一个假设无差错的分组中,而 latents 则按照每个 latent 的自信息从高到低贪心装入其余分组,并限制为 1460-byte 分组。
  • C. 擦除信道上的分类准确率: 擦除评估采用 DeiT-III-Large 和 LIC λ = 0.3,擦除概率为 p_e ∈ {0.05, 0.1, 0.15, 0.2, 0.3, 0.4, 0.5},并以预测均值替换被擦除的 latents。为隔离擦除效应,禁用选择性 latent 传输,将码率固定为 2.12 bpp;不进行分组的图像级编码为 2.11 bpp,表明分组开销可以忽略。
  • C. 擦除信道上的分类准确率: 在分组擦除信道上,将 Surrogate token substitution 与 direct-reconstruction 和 selected-patch inference 进行比较,前者始终是准确率最高的策略。所报告的擦除信道准确率取 20 次独立试验的平均值,其中 85.92% 是所提出框架在无错误条件下的参考准确率。

D. 熵感知图像传输 · E. Token 对齐的 Learned Image Compression · F. 层选择性 Attention Rollout

该框架通过熵感知传输和 Token 对齐的码率控制提升通信效率,同时借助层选择性 Attention Rollout,在不同 client ViT backbone 中准确且实用地识别相关 patch。

  • D. 熵感知图像传输: 采用 EIT 时,在 0.94 bpp 下达到 85.89% accuracy;在 accuracy 相当的情况下,不采用 EIT 约需 1.24 bpp。EIT 计算预测分布的 min-entropy,仅当其达到阈值 τ 时才调用 server inference,并额外增加一个 classification head。
  • E. Token 对齐的 Learned Image Compression: 改变 δ 并在不同 LIC model 之间切换,可在 0.5 bpp 到 2.5 bpp 范围内以较低 memory cost 实现接近最优 accuracy 的自适应码率控制。仅改变 δ 即可在狭窄的 bit-rate 范围内实现细粒度控制,无需切换 LIC model。
  • E. Token 对齐的 Learned Image Compression: 在匹配的实验设置下,mean hyperpriors 相较于不进行 mean imputation 的基于 hyperprior 的 LIC,可提升下游 accuracy。该增益来自对传输区域重建效果的改善,而非对未传输区域进行统一的 surrogate 填充。
  • F. 层选择性 Attention Rollout: 选择较后的 attention layer,尤其是 Ls = 7 且 Le = L 时,在主要工作区域取得最佳的 selected-patch inference performance。DeiT-Tiny 在交由 DeiT-III-Large classification 前选择 top-60、top-80 或 top-100 tokens。
  • F. 层选择性 Attention Rollout: 层选择性 attention rollout 在主要工作区域实现最有利的 rate–accuracy trade-off,且无需进行 gradient computation。在 (Ls, Le) = (7, 12) 设置下,将其与 last-layer attention、attention rollout 和 gradient-weighted attention 进行比较。
  • F. 层选择性 Attention Rollout: 当用 DeiT-Small 或 DeiT-Base 替换 DeiT-Tiny 时,层选择性 attention rollout 始终优于 last-layer attention 和 attention rollout。DeiT-Small 和 DeiT-Base 搜索的 layer range 分别为 (5, 12) 和 (7, 12)。
  • F. 层选择性 Attention Rollout: 层选择性 attention rollout 仅需 single forward pass,因此在 accuracy 相当时,对于更大的 client backbone,比 gradient-weighted attention 更实用。随着 client backbone 增大,gradient computation 会变得越来越不切实际。

G. Surrogate Token Substitution · VI. 结论

当使用具备 LIC 感知能力的输入和选定超参数进行训练时,surrogate token substitution 表现最佳;结论部分则将该工作概括为一个由预训练客户端、压缩和服务器模型构成的模块化框架。该框架通过开发 token 对齐的压缩和层选择相关性估计,改善 rate–accuracy trade-off。

  • G. Surrogate Token Substitution: Surrogate-token 训练分别使用 δsur 和 λsur 设置 token 选择阈值与 LIC 工作点,从而影响训练稳定性和最终准确率。这些超参数决定训练阶段输入的质量。
  • G. Surrogate Token Substitution: δsur = 0.35 在测试阶段阈值 δ ∈{0.6, 0.7, 0.79} 下均能取得近似最优的准确率,尽管训练阈值与测试阈值并不一致。在移除 LIC 模块后,针对 δsur 从 0.25 到 0.98 的取值分别训练 surrogate token,并据此选定该值。
  • G. Surrogate Token Substitution: 具备 LIC 感知能力的 surrogate token substitution 持续优于无适配和不具备 LIC 感知能力的基线,证明在训练过程中引入 LIC 感知能力可以带来性能提升。具备 LIC 感知能力的 token 使用 (δsur, λsur) = (0.35, 0.03),而不具备 LIC 感知能力的对应方法仅使用 δsur = 0.35。
  • VI. 结论: 所提出的框架协调预训练的客户端 ViT、LIC 和服务器端 ViT 模型,用于客户端–服务器协同推理。
  • VI. 结论: 基于 token 对齐的 learned image compression 根据 token 级任务相关性,有选择地传输空间对齐的 LIC latent。
  • VI. 结论: 在所提出的框架中,层选择 attention rollout 可从选定范围的 attention 层高效估计 token 相关性。
Loading 2608.25410v1…