模型训练 不同批次大小与学习率下的训练损失对比(3) 模型训练 不同批次大小与学习率下的训练损失对比3以 ConvNeXt 为例 论文中的一些做法flyfish一、ImageNet-1K 从头全量训练300 epochs原文We train ConvNeXts for 300 epochs using AdamW [46] with a learning rate of 4e-3. There is a 20-epoch linear warmup and a cosine decaying schedule afterward. We use a batch size of 4096 and a weight decay of 0.05.参数基准学习率4e-3批次大小4096学习率调度20轮线性预热linear warmup 余弦衰减cosine decaying schedule二、ImageNet-22K 大规模预训练90 epochs原文We pre-train ConvNeXts on ImageNet-22K for 90 epochs with a warmup of 5 epochs. We do not use EMA. Other settings follow ImageNet-1K.参数基准学习率与ImageNet-1K训练一致为4e-3批次大小与ImageNet-1K训练一致为4096学习率调度5轮线性预热 余弦衰减其余超参全部继承1K训练配置三、ImageNet-1K 分类微调基于22K预训练权重30 epochs原文We fine-tune ImageNet22K pre-trained models on ImageNet-1K for 30 epochs. We use AdamW, a learning rate of 5e-5, cosine learning rate schedule, layer-wise learning rate decay [6,12], no warmup, a batch size of 512, and weight decay of 1e-8.In fine-tuning, we use layer-wise learning rate decay [6, 12] with every 3 consecutive blocks forming a group.When the model is fine-tuned at 384² resolution, we use a crop ratio of 1.0 (i.e., no cropping) during testing following [2,74,80], instead of 0.875 at 224².参数基准学习率5e-5所有分辨率统一批次大小512学习率调度无预热余弦衰减分层学习率衰减每3个连续block为一组224×224分辨率衰减系数 0.8ConvNeXt-B/ 0.95ConvNeXt-L384×384分辨率衰减系数 0.7四、下游任务COCO 目标检测/实例分割原文We conduct a lightweight sweep for COCO experiments including learning rate {1e-4, 2e-4}, layer-wise learning rate decay [6] {0.7, 0.8, 0.9, 0.95}, and stochastic depth rate {0.3, 0.4, 0.5, 0.6, 0.7, 0.8}.Following Swin Transformer [45], we use multi-scale training, AdamW optimizer, and a 3× schedule.参数学习率网格搜索范围{1e-4, 2e-4}分层学习率衰减搜索范围 {0.7, 0.8, 0.9, 0.95}优化器AdamW训练策略3× schedule 多尺度训练五、下游任务ADE20K 语义分割原文The hyperparameters we sweep for ADE20K experiments include learning rate {8e-5, 1e-4}, layer-wise learning rate decay {0.8, 0.9}, and stochastic depth rate {0.3, 0.4, 0.5}. All model variants are trained for 160K iterations with a batch size of 16.参数学习率网格搜索范围{8e-5, 1e-4}批次大小16分层学习率衰减搜索范围 {0.8, 0.9}训练迭代数160K iterations训练范式参考原文In our study, we use a training recipe that is close to DeiT’s [73] and Swin Transformer’s [45].ConvNeXt 的学习率、批次大小等超参设计整体参考了同期视觉Transformer的标准训练范式。

相关新闻

最新新闻

Agentic优化:告别手动调参,解决图像转视频一致性难题

Agentic优化:告别手动调参,解决图像转视频一致性难题

最近接了一个图像生成视频的需求:一张产品图,需要让产品在镜头里旋转、展示细节,同时保持外观和原图完全一致。第一版生成出来,静态帧还算接近,但只要一开始运动,颜色、轮廓、材质、光感就开始“漂”。于是…

2026/8/30 16:58:49
代理AI部署:CPU与GPU如何配比与调优

代理AI部署:CPU与GPU如何配比与调优

代理AI这个概念,最近讨论热度明显上来了。很多人一开始接触代理AI,以为它就是“大模型API多调几次”,但真正往本地部署、往生产环境推的时候,会发现事情没那么简单:CPU占用率突然升高、GPU利用率偶尔掉到0、多任务并发…

2026/8/30 16:58:49
Excel卡死盲目换SQLite,我折腾半个月,才懂职场工具的最大误区

Excel卡死盲目换SQLite,我折腾半个月,才懂职场工具的最大误区

上个月发工资那天,我真的差点砸了电脑。不是工作多累,是被Excel反复卡死搞破防了。财政部安排我, 去清点三年内的人员变动信息条目, 总计两万多条, 实事求是讲, 数量确实不多。初始之时, 我不过是想着插入一个数据透视表, 将各个部门的离职率予以汇总, 简…

2026/8/30 16:58:49
RTKLIB从零到厘米级定位:后处理与实时模式实战教程

RTKLIB从零到厘米级定位:后处理与实时模式实战教程

简介:本资源是一套面向GNSS定位初学者的RTKLIB系统化入门教程,聚焦定位基本算法原理与工程实践,帮助零基础用户快速掌握实时动态(RTK)厘米级高精度定位的核心流程与工具链。资源共1319个文件,涵盖213个C源码…

2026/8/30 16:58:49
三角洲行动S10赛季倒子弹攻略:构建你的行情分析框架

三角洲行动S10赛季倒子弹攻略:构建你的行情分析框架

三角洲行动 S10 赛季已经开始一段时间,很多玩家在赛季更新后都会面临同一个问题:仓库里的物资价格波动剧烈,到底哪些东西适合倒卖,哪些东西只是看起来利润高、实际出手困难?如果你也关注过“倒子弹”这种玩法&#xff…

2026/8/30 16:58:49
LLM Agent Skill 凭据泄露:从原理到安全审计的实践指南

LLM Agent Skill 凭据泄露:从原理到安全审计的实践指南

我在调试一个自动化任务时发现,Agent 在调用某个工具失败后,把携带 Authorization 头的请求体原样打印进了 trace。那一刻我意识到,真正泄露密钥的不一定是模型,而是我们亲手写进 skill 里的那些“可复用封装”。这个标题——Cred…

2026/8/30 16:53:49