> ## Documentation Index
> Fetch the complete documentation index at: https://dripart-docs-custom-nodes-sdk-v2-frontend.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabsSpeechToText - ComfyUI Built-in Node Documentation

> ElevenLabs Speech to Text ノードは、ElevenLabs API を使用して音声をテキストに文字起こしします。

ElevenLabs Speech to Text ノードは、ElevenLabs API を使用して音声をテキストに文字起こしします。自動言語検出、話者ダイアライゼーション（異なる話者の識別）、およびオーディオイベントタグ付け（笑い声や音楽などの音を文字起こしに注釈付け）をサポートしています。

## 入力

### 共通入力

| パラメータ   | 説明                                                                             | データ型           | 必須  | 範囲             |
| ------- | ------------------------------------------------------------------------------ | -------------- | --- | -------------- |
| `モデル`   | 文字起こしに使用するモデル。このモデルを選択すると、追加のパラメータが表示されます。                                     | DYNAMIC\_COMBO | はい  | `"scribe_v2"`  |
| `音声`    | 文字起こしする音声。                                                                     | AUDIO          | はい  | -              |
| `言語コード` | ISO-639-1 または ISO-639-3 の言語コード（例：'en'、'es'、'fra'）。自動検出の場合は空のままにします。（デフォルト: ""） | STRING         | いいえ | -              |
| `話者数`   | 予測する最大話者数。自動検出の場合は 0 に設定します。（デフォルト: 0）                                         | INT            | いいえ | 0 - 32         |
| `シード値`  | 再現性のためのシード（決定性は保証されません）。（デフォルト: 1）                                             | INT            | いいえ | 0 - 2147483647 |

### Scribe v2 入力

これらのパラメータは、`"scribe_v2"` モデルが選択されたときに表示されます。

| パラメータ                    | 説明                                                                   | データ型    | 必須  | 範囲                                        |
| ------------------------ | -------------------------------------------------------------------- | ------- | --- | ----------------------------------------- |
| `tag_audio_events`       | 文字起こし内の（笑い声）、（音楽）などの音に注釈を付けます。（デフォルト: False）                         | BOOLEAN | いいえ | -                                         |
| `diarize`                | 誰が話しているかに注釈を付けます。（デフォルト: False）                                      | BOOLEAN | いいえ | -                                         |
| `diarization_threshold`  | 話者分離の感度。値が小さいほど話者の変化に敏感になります。`diarize` が有効な場合にのみ使用されます。（デフォルト: 0.22） | FLOAT   | いいえ | 0.1 - 0.4                                 |
| `temperature`            | ランダム性の制御。0.0 はモデルのデフォルトを使用します。値が大きいほどランダム性が高まります。（デフォルト: 0.0）        | FLOAT   | いいえ | 0.0 - 2.0                                 |
| `timestamps_granularity` | 文字起こしの単語のタイミング精度。（デフォルト: "word"）                                     | COMBO   | いいえ | `"word"`<br />`"character"`<br />`"none"` |

**注記:** `diarize` が有効な場合、`num_speakers` を 0 より大きい値に設定することはできません。`diarize` を無効にするか、`num_speakers` を 0 に設定する必要があります。

## 出力

| 出力名      | 説明                                                  | データ型   |
| -------- | --------------------------------------------------- | ------ |
| `テキスト`   | 音声から文字起こしされたテキスト。                                   | STRING |
| `言語コード`  | 音声の検出された言語コード。                                      | STRING |
| `単語JSON` | タイムスタンプや、有効な場合は話者ラベルを含む、詳細な単語レベルの情報を含む JSON 形式の文字列。 | STRING |

> このドキュメントは AI によって生成されました。エラーを見つけた場合や改善のご提案がある場合は、ぜひ貢献してください！ [GitHub で編集](https://github.com/Comfy-Org/embedded-docs/blob/main/comfyui_embedded_docs/docs/ElevenLabsSpeechToText/ja.md)

***

**Source fingerprint (SHA-256):** `7eb5d72615aa8a9e4a8014e45b39cf83dc8d8432d7ce0dccba20489be80a5830`
