目前正在预研一个低成本的识图方案,场景是家用安防摄像机的。
目前调研了有两个方向
一个是以 yolo 、aws rekonition 为代表的传统的 CNN 识图方案,
其中 yolo 面临的问题是现成的模型有标签不足够覆盖场景,要自己训练心里没底
直接用 aws rekonition 的成本很高,谈了折扣算下来也还是很高
传统方案有另一个弊端就是对于抽象的"词"无法理解,比如想要对"危险情况"做识别,只能分解到具体的事物,比如火焰、枪支、刀具等。
另一个是走大模型的识图方向
1. 自己部署开源模型,Qwen2.5 VL 系列和 Janus-Pro ,7B 和 32B 都试了,感觉效果不佳
2. 调 Api ,试了几家,发现 aws nova 在价格和效果上都很不错
我纯后端开发,计算机视觉和大模型方面是个小白
站内的大佬有在这方面有经验的吗,有什么经验可以分享一下,谢谢你~
目前调研了有两个方向
一个是以 yolo 、aws rekonition 为代表的传统的 CNN 识图方案,
其中 yolo 面临的问题是现成的模型有标签不足够覆盖场景,要自己训练心里没底
直接用 aws rekonition 的成本很高,谈了折扣算下来也还是很高
传统方案有另一个弊端就是对于抽象的"词"无法理解,比如想要对"危险情况"做识别,只能分解到具体的事物,比如火焰、枪支、刀具等。
另一个是走大模型的识图方向
1. 自己部署开源模型,Qwen2.5 VL 系列和 Janus-Pro ,7B 和 32B 都试了,感觉效果不佳
2. 调 Api ,试了几家,发现 aws nova 在价格和效果上都很不错
我纯后端开发,计算机视觉和大模型方面是个小白
站内的大佬有在这方面有经验的吗,有什么经验可以分享一下,谢谢你~
