Azure AI 语音转文本 Python SDK

azure-ai-transcription-py
分类编程
作者Agentic Awesome Skills 社区
许可MIT
评分4.50/5
使用6.4K

Azure AI Transcription Python SDK

Azure AI Transcription(语音转文本)客户端库,支持实时和批量转录。

安装

bash
pip install azure-ai-transcription

环境变量

bash
TRANSCRIPTION_ENDPOINT=https://<resource>.cognitiveservices.azure.com
TRANSCRIPTION_KEY=<your-key>

身份验证

使用订阅密钥进行身份验证(此客户端不支持 DefaultAzureCredential):

python
import os
from azure.ai.transcription import TranscriptionClient

client = TranscriptionClient(
endpoint=os.environ["TRANSCRIPTION_ENDPOINT"],
credential=os.environ["TRANSCRIPTION_KEY"]
)

转录(批量)

python
job = client.begin_transcription(
    name="meeting-transcription",
    locale="en-US",
    content_urls=["https://<storage>/audio.wav"],
    diarization_enabled=True
)
result = job.result()
print(result.status)

转录(实时)

python
stream = client.begin_stream_transcription(locale="en-US")
stream.send_audio_file("audio.wav")
for event in stream:
    print(event.text)

最佳实践

1. 当存在多个说话人时,启用说话人日志 (diarization)
2. 对于存储在 Blob 存储中的长文件,使用批量转录
3. 获取时间戳以生成字幕
4. 指定语言以提高识别准确率
5. 在实时转录中处理流背压 (backpressure)
6. 完成后关闭转录会话

使用场景

此技能适用于执行概述中描述的工作流或操作。

局限性

  • 仅在任务明确符合上述范围时使用此技能。
  • 不要将输出视为环境特定验证、测试或专家评审的替代方案。
  • 如果缺少必要的输入、权限、安全边界或成功标准,请停止并请求澄清。