from google import genai client = genai.Client() # Upload audio file… — Tensorflow(@CVision) — TG.ME

Tensorflow(@CVision)گوگل یک قدم جدی‌تر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفته‌ی گوگل، دقیق‌ترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمه‌به‌کلمه‌ی…
from google import genai

client = genai.Client()

# Upload audio file via the Files API
audio_file = client.files.upload(file="path/to/audio.wav")

# Transcribe with speaker diarization and word timestamps
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[{
"type": "audio",
"uri": audio_file.uri,
"mime_type": audio_file.mime_type,
}],
generation_config={
"transcription_config": {
"language_codes": ["en-US"],
"custom_vocabulary": ["Gemini", "Transcribe"],
"mode": {
"type": "verbatim",
"diarization_mode": "speaker",
"timestamp_granularities": ["word"],
}
}
}
)

print(interaction.output_text)


دریافت api key
❤16👍2
August 28, 2026 1.6K 53