開源模型與電腦視覺
FeyNoBg、BiRefNetの中間ステージを深化し、混合データで前景認識と境界の精細さを両立
Feynは、2億6,300万パラメータのFeyNoBgと、学習用ライブラリNoBgをオープンソースで公開し、背景除去、バッチ推論、ファインチューニングのインターフェースを統一した。公式比較では、8つのデータセットのうち4つでS-measureが首位となった一方、速度、メモリ使用量、透明度誤差などのデプロイ指標は報告されていない。

Feynは7月27日、自動背景除去モデル「FeyNoBg」と、モデルの学習、推論、再パラメータ化に使用するオープンソースのPythonライブラリ「NoBg」を公開した。この取り組みが扱うのは、単純な二値セグメンテーションではない。システムはまず前景全体を認識し、そのうえで髪、毛皮、細い線、モーションブラーなどの境界における透明度を予測する必要がある。偏りのあるデータ配合で学習すると、この2つの能力はしばしばトレードオフになる。
モデルはBiRefNetを基盤とし、位置特定と境界再構築を担うデュアルパス設計を維持している。さらに、特徴抽出器の第3ステージを18ブロックから24ブロックへと深層化し、パラメータ数を2億2,200万から2億6,300万へ増やした。チームは形状に互換性のある事前学習済み重みをすべて引き継ぎ、新しく追加したブロックだけを初期化した。容量を拡張しながら、既存能力の忘却リスクを抑える狙いだ。
データ配合も主要な変更点となっている。初期段階では合成マスクデータのMaskFactoryのみを使用したため、CAMOでは改善したものの、DIS5Kのスコアは低下した。最終版では、カモフラージュ、混雑したシーン、高解像度の人物、アニメを含む10のデータソースから約2万6,100枚の画像を採用した。各ソースの上限は4,000枚とし、segmentation maskとalpha matteはいずれも一貫した二値の学習ターゲットに変換した。公式発表によると、FeyNoBgは8つのテストのうち4つで、公開済みの結果として最高のS-measureを記録し、残るテストでも首位との差は2%以内だった。
NoBgは、モデルのロード、画像処理、バッチ推論とBF16推論、Hugging Face Trainerによるファインチューニング、モデルのアップロードを一貫したインターフェースにまとめている。ライブラリはApache-2.0、モデルカードにはMITと記載されている。ただし、S-measureは主に構造と形状を評価する指標であり、半透明なエッジの視覚品質を完全には表せない。比較表でも、エンドツーエンドのレイテンシ、GPUメモリ使用量、動画における時間的一貫性、各データセットでの統計的有意性は公開されていない。エンジニアリングチームは次の段階として、自社の画像分布上でalpha誤差、細い境界の失敗率、スループット、ライセンス互換性を併せて検証し、既存のmattingパイプラインを置き換えるかどうかを判断すべきだ。