Topic
#computer-vision
按主题聚合的新闻视图。
Topic Feed
主题:computer-vision
共 4 条

Perceptron推出Isaac 0.5工厂视觉AI
由两名前 Meta FAIR 科学家创办的初创公司 Perceptron 发布了 Isaac 0.5,这是一款面向工业环境的开权重视觉模型。公司表示,该模型可帮助机器人在仓库和工厂车间等场景中进行感知、推理和行动。

DeepMind将视频生成器转为视觉模型
Google DeepMind 的 GenCeption 将一个预训练的视频生成器改造成经典计算机视觉任务模型,可用于深度估计、分割、表面法线和 3D 姿态估计。该模型基于阿里巴巴开源的 Wan2.1 视频模型,主要使用合成视频训练,却在基准测试中取得了很强的结果。

Count Anything 让看似简单的计数更进一步
清华大学及其他机构的研究人员推出了“Count Anything”,这是一种基于提示词的视觉模型,可以在多种图像类型中对对象进行计数和标注,包括照片、卫星图像、医学扫描图像和显微镜图像。它基于 Meta 的 SAM3 构建,并把适合大目标的框计数与适合小而密集目标的点计数结合起来。

Falcon OCR:一种用于开源OCR的统一早期融合Transformer模型
TII UAE与Hugging Face发布了Falcon OCR,这是一个参数量为0.3B的开源模型,在OCR基准测试中取得优异成绩(olmOCR得分为80.3,OmniDocBench得分为88.6),并采用单一早期融合Transformer架构。