100% OpenAI SDK互換

Speech to Text APIWhisper APIの代替手段

数秒で高精度な文字起こしをアプリに統合できます。OpenAIのbase URLを差し替えるだけで、半額のコスト標準搭載の話者分離機能を利用できます。

月額費用なし
従量課金制
python_sdk_example.py
from openai import OpenAI

# 1. base_urlとapi_keyを変更するだけ!
client = OpenAI(
  api_key="fat-xxxxxxxxx",
  base_url="https://api.freeaudiototext.com/v1"
)

# 2. すでに書いたコードをそのまま使えます
transcript = client.audio.transcriptions.create(
  model="whisper-1",
  file=open("meeting.mp3", "rb"),
  response_format="diarized_json" # 話者分離に対応しています!
)

print(transcript.segments[0].speaker) # 出力: "SPK_1"

OpenAI Whisperから乗り換える理由

ネイティブな話者分離

膨大なテキストの塊を返すだけのOpenAIのAPIとは異なり、私たちの高度なモデルは、英語と中国語について、正確な単語レベルのタイムスタンプとともに話者(例:SPK_1、SPK_2)を自動的に分離します。

コード変更ゼロ

公式の`openai-python`やNode.jsのSDKと完全に互換性があります。`base_url`を私たちのサーバーに向けるだけです。新しいライブラリを学ぶ必要も、アーキテクチャを書き直す必要もありません。

コストを50%削減

OpenAIの料金は1分あたり0.006ドルです。当社のAPIは1分あたりわずか0.003ドルから利用できます。精度を犠牲にすることなく、文字起こしビジネスの規模を拡大し、数千ドルを節約しましょう。

APIドキュメントと出力例

リクエストにresponse_format="diarized_json"を渡すと、文字起こしのセグメントと一緒に話者のラベルを受け取ることができます。私たちはOpenAIのスキーマに厳密に従っています。

JSONレスポンス(話者分離あり)
{
  "task": "transcribe",
  "duration": 27.4,
  "language": "english",
  "text": "Thanks for calling support. Hi, I'm trying to enable diarization...",
  "segments": [
    {
      "id": "seg_001",
      "start": 0.0,
      "end": 4.7,
      "text": "Thanks for calling support.",
      "speaker": "SPK_1"
    },
    {
      "id": "seg_002",
      "start": 4.7,
      "end": 11.8,
      "text": "Hi, I'm trying to enable diarization.",
      "speaker": "SPK_2"
    }
  ],
  "usage": {
    "type": "duration",
    "seconds": 27
  }
}

従量課金制

前払いのクレジットを購入します。サブスクリプションも、有効期限切れのトークンもありません。

Hobby

テストやサイドプロジェクトに最適

$4.90
  • 20時間の音声
  • $0.245 / 時間
一番人気

Pro

インディーハッカーやアクティブなアプリ向け

$19.00
  • 150時間の音声
  • $0.126 / 時間 (OpenAIから65%オフ)

Agency

大量の文字起こし

$49.00
  • 500時間の音声
  • $0.098 / 時間
支払いはWaffoによって安全に処理されます。APIキーは即座にメールで配信されます。

よくある質問

支払い後、どのようにしてAPIキーを受け取りますか?
決済が完了すると、当社のシステムが安全に一意のAPIキーを生成し、支払い時にご提供いただいたメールアドレスに直接メールでお送りします。アカウント登録は必要ありません!
音声ファイルはサーバーに保存されますか?
いいえ。私たちはプライバシーを第一に考えるAPIです。音声ファイルは文字起こしの処理中のみ一時的に暗号化して保存され、24時間以内に自動的かつ完全に削除されます。モデルのトレーニングにあなたのデータを使用することは決してありません。
話者分離はすべての言語で機能しますか?
高精度な単語レベルの話者分離(重なった声の分離)は、英語中国語で完全にサポートされています。その他の30以上の言語については、VAD(音声区間検出)のフォールバックを使用し、自然な間(ポーズ)に基づいて話者を分割します。
APIクレジットの残高はどのように確認できますか?
APIキーをBearer Tokenとして使用し、当社の/v1/balanceエンドポイントに簡単なGETリクエストを実行できます:

curl https://api.freeaudiototext.com/v1/balance \
  -H "Authorization: Bearer fat-xxxxxxxxx"
秒と分の両方で残高が即座に返されます。