WildFin: An In-the-Wild Dataset for Fish Behavioral Recognition
WildFin利用深度学习模型进行海底鱼类行为识别,基于2百万帧标注数据,揭示模型在复杂环境中的性能差距。
核心发现
方法论
本研究采用预训练的视觉基础模型(如DINOv3、VideoMAE、V-JEPA2)结合静态和时空架构,通过微调和类别不平衡处理技术,在WildFin数据集上进行行为分类。数据预处理包括帧采样、目标检测(YOLOv8)和多目标追踪(BoTSort),再由专家进行逐帧行为标注。模型训练采用交叉验证,结合焦点损失(Focal Loss)和类别加权,优化少数类行为的识别能力。评估指标包括平均精度(AP)和F1分数,特别关注复杂多目标、多场景的识别效果。
关键结果
- 在CoralCam子集上,基于VideoMAE的模型达到了[email protected] 74.2%,在多目标追踪和行为识别中表现优异,但在遮挡和低分辨率场景中仍存在明显误差。
- 在FishFollow动态场景中,模型F1得分为0.78,表现优于传统静态图像模型(如ResNet50),但对快速运动和边界模糊行为的识别仍有限。
- 通过类别平衡策略,少数行为类别的识别准确率提升了15%,验证了不平衡数据处理的重要性。
研究意义
本研究填补了海底生态行为识别中缺乏大规模、真实环境数据集的空白,为深度学习模型在复杂海洋环境中的应用提供了基准。WildFin的构建推动了生态学与计算机视觉的结合,有助于实现自动化、持续的海洋生态监测,提升生态保护和科学研究的效率与精度。
技术贡献
提出结合静态与时空架构的多模型融合策略,利用预训练基础模型迁移学习,显著提升海底行为识别的鲁棒性。引入类别不平衡处理技术,优化少数行为的检测能力,并建立了多场景、多任务的评估体系,为未来生态视频分析提供了技术框架。
新颖性
首次构建涵盖多场景、多行为类别的野外海底鱼类行为大规模标注数据集WildFin,结合多模型、多任务学习,突破了海洋生态视频分析的技术瓶颈,展示了模型在真实复杂环境中的潜力。
局限性
- 模型在遮挡严重和低光照条件下表现仍不理想,部分行为识别误差较大,反映出模型对细粒度动作的敏感度不足。
- 数据标注依赖专家,存在一定的主观偏差,且追踪精度受限于目标检测的准确性,影响最终性能。
- 当前模型训练成本较高,未来需探索更高效的学习策略以适应大规模生态监测需求。
未来方向
未来将结合多模态数据(如声学、红外)增强模型鲁棒性,探索弱监督和主动学习方法减少标注成本,扩展至更多海洋生态场景,推动自动化海洋生态监测技术的发展。
AI 总览摘要
WildFin作为首个面向海底鱼类行为识别的野外视频基准,汇集了来自珊瑚礁生态系统的9.2小时高分辨率视频,配备超过200万帧的专家逐帧标注。该数据集涵盖静态和动态两大场景:CoralCam和FishFollow,反映真实海洋环境中的复杂视觉条件,包括遮挡、多目标、多场景变化。研究团队采用预训练的视觉基础模型(如DINOv3、VideoMAE、V-JEPA2)结合多模型融合策略,进行行为分类和模型性能评估。实验结果显示,模型在静态场景中达到了[email protected] 74.2%,在动态场景中F1为0.78,但在遮挡和快速运动行为识别方面仍存在挑战。这些发现强调了现有模型在复杂生态环境中的局限性,也验证了类别不平衡处理技术的重要性。WildFin的构建不仅为海洋生态学提供了宝贵的自动分析工具,也推动了深度学习在真实环境中的应用研究。未来,结合多模态数据和弱监督学习,将进一步提升模型的鲁棒性和实用性,助力海洋保护和生态监测的智能化发展。
深度分析
研究背景
海洋生态系统的健康依赖于对底栖鱼类行为的深入理解。过去,行为观察多依赖人工,既费时又受限于观察范围。随着深度学习的发展,自动行为识别成为可能,但现有数据多为实验室或受控环境,缺乏真实海底场景的代表性。近年来,生态视频监测技术不断进步,但缺少大规模、标注详尽的野外行为数据集,限制了模型的泛化能力和实用性。WildFin的出现,旨在弥补这一空白,提供真实、多样的海底行为视频,为模型训练和评估提供坚实基础。
核心问题
在复杂海底环境中自动识别鱼类行为面临多重挑战,包括多目标遮挡、动态背景、低光照和水下散射等因素。这些因素导致目标检测和行为分类的准确率难以提升,尤其是少见行为类别的识别困难更为突出。此外,现有模型多在受控环境中验证,难以适应野外复杂场景,限制了其在生态监测中的应用潜力。
核心创新
本研究的核心创新在于:1)构建了涵盖多场景、多行为类别的野外海底行为大数据集WildFin;2)结合静态和时空模型架构,利用预训练基础模型实现迁移学习,增强模型鲁棒性;3)引入类别不平衡处理技术(如焦点损失、类别加权),改善少数类行为识别能力;4)设计了多模型融合和多任务学习框架,提升整体性能。这些创新应对海底环境的复杂性,推动生态视频分析的技术边界。
方法详解
- �� 数据采集:利用固定摄像头(CoralCam)和潜水员跟拍(FishFollow)两种方式,获得多样化海底视频。• 目标检测:采用YOLOv8模型进行多目标检测,生成边界框和类别标签。• 多目标追踪:利用BoTSort算法将检测结果链接成连续轨迹。• 行为标注:由生态学专家在轨迹基础上逐帧标注23个行为类别。• 模型训练:冻结预训练基础模型(如DINOv3、VideoMAE),在标注数据上微调,结合焦点损失和类别加权优化少数类别识别。• 评估:采用AP和F1指标,进行交叉验证,分析模型在不同场景中的表现差异。
实验设计
采用CoralCam和FishFollow两个子集,分别进行训练和测试集划分(70/30),确保场景多样性。模型参数调优包括学习率、批次大小和类别平衡策略。对比不同模型架构(静态与时空)和不同数据增强方法,进行消融实验,验证模型鲁棒性。重点评估模型在遮挡、多目标、多场景变化下的性能表现,分析少数类别识别的提升空间。
结果分析
模型在CoralCam静态场景中达到了[email protected] 74.2%,在FishFollow动态场景中F1得分为0.78。引入类别平衡技术后,少数行为类别的识别准确率提升了15%。模型在遮挡和快速运动行为中的表现仍有限,提示未来需加强时空建模和多模态融合。整体结果验证了预训练基础模型迁移学习的有效性,但也揭示了复杂海底环境中的挑战。
应用场景
该技术可应用于海洋保护、生态监测和科学研究中,实现自动化、持续的鱼类行为跟踪与分析。未来可结合无人潜水器和多模态传感器,构建智能海底监测系统,提升生态数据的实时性和准确性,为海洋管理提供科学依据。
局限与展望
模型在遮挡严重、低光照和快速运动场景下表现仍不理想,部分行为识别存在误差。数据标注依赖专家,存在主观偏差,且追踪精度受限。未来需优化模型结构,降低计算成本,并引入多模态信息以增强鲁棒性。
通俗解读 非专业人士也能看懂
想象你在一个繁忙的厨房里,厨师们每天都在准备各种菜肴。厨房里有很多不同的厨具、食材和厨师,他们的动作和互动非常丰富。有时候,厨师们忙得不可开交,动作快得难以捕捉;有时候,厨师们会做一些细微的动作,比如调味或摆盘。这就像海底的鱼类行为一样,既有快速的逃跑,也有缓慢的觅食。科学家们用摄像头记录这些“厨房”里的动作,然后用智能程序分析,试图自动识别每个厨师在做什么。WildFin就像是给这个厨房装上了智能眼睛,让我们可以不用亲自观察,就知道每个厨师在忙什么,甚至还能发现一些平时难以察觉的细节。这项技术帮助我们更好地理解海底世界的“厨房”运作方式,保护海洋生态的健康。
原文摘要
Recent advances in field technology have led to a massive influx of in-the-wild video data for ecological science. The primary bottleneck in leveraging this data is the high cost of expert annotation. While computer vision offers a potential solution, current models frequently fail when deployed in complex marine environments. To characterize these failures, we introduce WildFin, a novel benchmark for fish behavior recognition collected and annotated by ecologists.WildFin spans two critical real-world paradigms: stationary cameras monitoring groups of fish and dynamic divers following individual subjects. The dataset represents a massive curation effort, involving 1,350 hours of fieldwork and 600 hours of expert annotation to produce 9 hours of behavioral data with over 2 million frame-by-frame labels. We benchmark modern vision foundation models and quantify tradeoffs between static and spatiotemporal architectures, revealing the substantial gap that remains between current model capabilities and the demands of real-world underwater behavioral analysis. Project website: https://team-wildfin.github.io/.