「LensVLM-9B」長文を画像として縮小して処理する視覚言語モデル:必要VRAM 4GB〜・GGUF版あり
AppleがQwen3.5-9Bをベースに開発した視覚言語モデル「LensVLM-9B」をHugging Faceで公開。長い文書を画像として縮小し、必要なページだけ拡大して読むことでメモリを大幅に削減する非商用研究モデルの仕組みとス ...
手元で動くオープンウェイトモデルのニュース
AppleがQwen3.5-9Bをベースに開発した視覚言語モデル「LensVLM-9B」をHugging Faceで公開。長い文書を画像として縮小し、必要なページだけ拡大して読むことでメモリを大幅に削減する非商用研究モデルの仕組みとス ...