開発者の構成から始める
開発者は意味検索にbge-m3:latest、生成に gemma3:4b を使っています。具体的な出発点であり、すべての端末での性能を保証するものではありません。
1
Ollamaをインストールして起動
公式ダウンロードのOS別手順に従って起動してください。既定のローカル接続先は
http://localhost:11434 です。すでにサービスが動作している場合、二重に起動しないでください。2
モデルをダウンロード
ClipsXと同じ端末のターミナルで実行します。一覧にモデル名があることを確認します。検索だけならGemmaは不要です。ダウンロードにはインターネットが必要ですが、ローカル推論にはインストール済みのモデルを使います。
3
ClipsXを接続
インテリジェンス → モデルで
http://localhost:11434 を入力し、接続します。成功すると、インストール済みモデルと対応能力が表示されます。モデルを追加したら接続情報を更新してください。4
必要な機能を有効化
意味検索で
bge-m3:latest を選び、有効にします。モデルの検証後、対象クリップをバックグラウンドで索引化します。Recallや対応拡張機能を使うには、ローカルテキスト生成で gemma3:4b を選んで有効にします。接続だけでは各機能は有効になりません。埋め込みモデルを選ぶ
検索用のベクトルを作るモデルです。回答の文章は生成しません。ClipsXはOllamaが埋め込み対応と報告するモデルを表示し、有効化時に出力を検証します。
代替モデルは評価する候補であり、ClipsXで独立した性能比較を済ませた構成ではありません。いずれかをダウンロードし、モデル一覧を更新して選びます。
生成モデルを選ぶ
文章を生成するモデルです。モデルが画像やツールに対応していても、ClipsXのテキスト生成処理にその機能が追加されるわけではありません。
例:
ollama list の識別子を添えてください。
資源の使用量を理解する
各モデルのライセンスと提供元の条件を確認してください:BGE-M3, Gemma 3, EmbeddingGemma, Gemma 4, Qwen 3.5, Qwen3 Embedding upstream。Qwenモデルは公式ページのライセンスやモデルカードへのリンクを確認します。同じOllama APIを使っていても、ライセンスは同じとは限りません。 ダウンロードサイズやパラメータ数はRAM・VRAM要件ではありません。量子化、コンテキスト、読み込んだモデル数でも使用量は変わります。CPU処理は遅くなる場合があり、長いコンテキストはメモリを多く使います。一定の端末仕様や速度は保証していません。 処理中にollama ps でモデルとCPU・GPUの配置を確認できます。短い文章から試してください。負荷が大きい場合は小さいモデルを評価する、重い処理を閉じる、AIなしで通常の検索を使う、といった選択があります。
推論をローカルに保つ
端末にダウンロードするタグを使います。Ollamaにはクラウドモデルもあるため、ループバック接続だけではローカル推論の証明になりません。モデルとOllama設定を確認し、端末内で処理したい場合はクラウド版を選ばないでください。モデルには各処理に必要な文章が渡されます。拡張機能には別途権限の境界があります。復旧と無効化
- 接続できない: Ollamaの起動と接続先を確認し、再接続前に
ollama listを試します。 - 対応モデルがない: 必要な能力のモデルをダウンロードし、一覧を更新して選びます。
- 索引の失敗: インテリジェンスの索引画面で、対象クリップと診断を確認してから再試行します。
- 生成の失敗や不適切な回答: モデル名を確認し、入力を短くするか別のモデルを評価します。同じAPIでも能力や結果は保証されません。
- AIを停止: 対応するモデル欄で無効にします。保存済み索引の削除は別の索引操作です。元のクリップは保持されます。