96SEO 2026-02-23 11:27 25
零样本学习------稳健的语义特征能力----富含语义信息的训练数据集----使用SOS数据集(主要关注语义重要区域内的低频特征)

密集预测任务-----处理高频细节--------擅长密集预测的与训练模型----使用COS模型(善于识别勾勒伪装对象边缘至关重要的高频特征)
SOS数据集 COS模型
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031164726386-783716460.png"
先使用MIM(掩码图像建模)(一种自监督学习方法)进行预训练(MIM在捕捉高频细节方面有优势,提高模型在识别微小、复杂对象边界的精度(提高细节分辨率)),
再使用SOS数据集进行进一步改进(SOS数据通过细粒度对齐强调可辩别的语义对比(增强感知范围))。
上面提到了“SOS数据通过细粒度对齐强调可辩别的语义对比”,所以我们整合了M-LLM来提供细粒度对齐的caption(优化模型以捕获密集预测任务的复杂语义特征)。
MIM预先训练的图像编码器生成视觉嵌入,M-LLM在图像旁边处理prompt生成文本嵌入。
视觉嵌入与文本嵌入接着被对齐。
问:论文中提出,ZSCOD(零样本伪装目标检测)和OVCOS(开放词汇伪装目标分割)仍依赖COS数据集进行微调?
1、因为ZSCOD和OVCOS必须用COS数据微调以适配伪装任务特性,通过COS数据微调来
“锚定伪装任务特性”。
“目标与背景无明显边界”)。
4、而GenSAM不依赖COS数据集,是因为它复用了SAM强大的通用分割能力(通过SA-1B数据集
的能力,无需通过COS数据微调来学习“边缘捕捉”)+
训练过,能理解“伪装目标”的语义概念,不需要再通过COS数据集微调来学习“伪装”)。
1、PEFT部分
输入一张图片X,被块嵌入分割成块,并投影成图像嵌入E。
最初的Transformer块这样实现(i表示第i层):
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031145335489-897926953.png"
第i层得到的输出E将作为第i+1层的输入E。
上采样(Wup升维)”。
与传统Adapter相比,移除了层归一化LN,增加了偏置项(更精准地学习“通道级别的形状偏向特征”)。
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031172144564-1318316618.png"
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031145608186-673034838.png"
将Adapter注入到Transformer块的前馈网络FFN分支中,保留分支(能保留MIM预训练学到的基础特征),加入Adapter(让Adapter专注学习SOS数据集的语义信息)。
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031151017704-776697615.png"
2、多尺度特征变化(简单特征金字塔SFP)
低分辨率特征(如HW/32^2)适合捕捉大尺寸伪装目标的全局轮廓,高分辨率特征(如(H
W/4^2))适合定位小尺寸伪装目标的局部细节(如昆虫的触角、鳞片)。
MFA(多尺度细粒度对齐)模块对齐,为精准分割提供
3、M-LLM生成caption嵌入
输入图片X,任务提示T,M-LLM得到对应caption嵌入。
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031151702178-2119720659.png"
4、MFA多尺度细粒度对齐
MFA包含三部分:特征投影仪、文本混合器、多尺度token匹配
多尺度图像嵌入
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031152627105-2006672056.png"
class="lazyload">输入进特征投影仪得到多尺度图像token
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031153751076-2094680520.png"
caption嵌入
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031152711430-48873287.png"
class="lazyload">和可学习查询
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031152743075-8554620.png"
class="lazyload">输入进文本混合器,得到文本token
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031154003575-722606218.png"
class="lazyload">和查询token
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031154023056-73552453.png"
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031154040303-2052179096.png"
图像token、文本token、查询token输入进MFA得到:image-grouped
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031152900244-1338094967.png"
class="lazyload">和image-grouped
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031152938119-1884815280.png"
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031154646880-471013458.png"
详细讲一下对齐的操作(计算相似度---归一化----稀疏化):
(1)
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031155659553-923258037.png"
(2)相似度矩阵中的数值范围差异较大,所以进行归一化;
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031155957133-1271255211.png"
5、文本混合器与特征投影器
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031164858519-2110200649.png"
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031164931348-546398962.png"
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031164955512-949729121.png"
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031165008111-415854353.png"
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031165028059-1369125736.png"
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031165040264-229886946.png"
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031165104723-693827933.png"
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031165123106-1967191785.png"
6、推理阶段使用查询Q替换掉M-LLM。
和损失函数
训练阶段掩码解码器的输入是I(N),推理阶段换成Q(N)。
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031165903045-1874534885.png"
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031165912431-1639196578.png"
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031165920971-1705927800.png"
1、零样本设置:
(1)EVA提前用MIM预训练,提前用SOS数据集预训练(5个):VST、SINet-V2、CRNet、EVP-Segformer、EVP-EVA02-L
(2)不训练,直接用COS数据集检测成果(4个):CAMO、COD10K、CHAMELEON、NC4K
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031185857058-1969044334.png"
2、监督学习设置:
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031190023526-1776598789.png"
3、消融实验。
(2)文本混合器中:线性投影仪、线性
(3)MFA模块中:特征投影仪
(4)PEFT的实现:Adapter
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031190611272-1039690174.png"
(5)任务prompt(table
data-src="https://img2024.cnblogs.com/blog/3708734/202510/3708734-20251031190654748-658735186.png"
“伪装物体”。
所以通过指定伪装对象并详细描述,码本能够学习针对这些特定对象量身定做的更有效地表示,从而提高模型性能。
作为专业的SEO优化服务提供商,我们致力于通过科学、系统的搜索引擎优化策略,帮助企业在百度、Google等搜索引擎中获得更高的排名和流量。我们的服务涵盖网站结构优化、内容优化、技术SEO和链接建设等多个维度。
| 服务项目 | 基础套餐 | 标准套餐 | 高级定制 |
|---|---|---|---|
| 关键词优化数量 | 10-20个核心词 | 30-50个核心词+长尾词 | 80-150个全方位覆盖 |
| 内容优化 | 基础页面优化 | 全站内容优化+每月5篇原创 | 个性化内容策略+每月15篇原创 |
| 技术SEO | 基本技术检查 | 全面技术优化+移动适配 | 深度技术重构+性能优化 |
| 外链建设 | 每月5-10条 | 每月20-30条高质量外链 | 每月50+条多渠道外链 |
| 数据报告 | 月度基础报告 | 双周详细报告+分析 | 每周深度报告+策略调整 |
| 效果保障 | 3-6个月见效 | 2-4个月见效 | 1-3个月快速见效 |
我们的SEO优化服务遵循科学严谨的流程,确保每一步都基于数据分析和行业最佳实践:
全面检测网站技术问题、内容质量、竞争对手情况,制定个性化优化方案。
基于用户搜索意图和商业目标,制定全面的关键词矩阵和布局策略。
解决网站技术问题,优化网站结构,提升页面速度和移动端体验。
创作高质量原创内容,优化现有页面,建立内容更新机制。
获取高质量外部链接,建立品牌在线影响力,提升网站权威度。
持续监控排名、流量和转化数据,根据效果调整优化策略。
基于我们服务的客户数据统计,平均优化效果如下:
我们坚信,真正的SEO优化不仅仅是追求排名,而是通过提供优质内容、优化用户体验、建立网站权威,最终实现可持续的业务增长。我们的目标是与客户建立长期合作关系,共同成长。
Demand feedback