EDT：针对Low-Level视觉任务的一种高效Transformer基准框架

原创

已于 2023-12-18 15:39:21 修改 · 1.6k 阅读

标签

#人工智能 #超分辨率重建 #深度学习 #计算机视觉 #transformer

于 2023-12-12 00:08:33 首次发布

本文提出了一种针对低级视觉任务的高效Transformer框架，通过改进窗口注意力机制，研究了Transformer在预训练中的应用，首次深入探讨了预训练如何影响模型内部表示并提供了有效预训练的见解。文章还介绍了ShiftedCrossedLocalAttention和CSWinTransformer结构，以及使用分组卷积的Anti-BlockingFFN模块。

低功耗蓝牙项目，需要一块懂省电的板

思澈 SF32LB52 芯片，BLE 协议栈深度优化，上手即开发

点击查看

EDT：On Efficient Transformer-Based Image Pre-training for Low-Level Vision

论文地址：On Efficient Transformer-Based Image Pre-training for Low-Level Vision

代码地址：fenglinglwb/EDT: On Efficient Transformer-Based Image Pre-training for Low-Level Vision

现阶段问题

预训练在high-level计算机视觉中产生了许多最先进的技术，但很少有人尝试研究预训练如何在low-level任务中。

主要贡献

提出了一个用于低级视觉的高效且通用的Transformer框架：改进window attention，分别从高、宽进行切块计算注意力。
是第一个对低级视觉的图像预训练进行深入研究的人，揭示了预训练如何影响模型的内部表示以及如何进行有效的预训练的见解

网络框架

2023-11-29_20-15-27

Shifted Crossed Local Attention

CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows基础上进行改进。
$\begin{aligned} &\mathbf{X}=[\mathbf{X}_{1},\mathbf{X}_{2}],\mathrm{~where~}\mathbf{X}_{1},\mathbf{X}_{2}\in\mathbb{R}^{(H\times W)\times^{C/2}}, \\ &\mathbf{X}_{1}^{'}=\mathrm{H-MSA}(\mathbf{X}_{1}), \\ &\mathbf{X}_{2}^{^{\prime}}=\mathrm{V-MSA}(\mathbf{X}_{2}), \\ &(\mathrm{S})\mathrm{CL-MSA}(\mathbf{X})=\mathrm{Proj}([\mathbf{X}_{1}^{'},\mathbf{X}_{2}^{'}]), \end{aligned}$