diff options
| -rw-r--r-- | asr.py | 68 |
1 files changed, 68 insertions, 0 deletions
| @@ -0,0 +1,68 @@ | |||
| 1 | import librosa | ||
| 2 | import soundfile as sf | ||
| 3 | import onnx_asr | ||
| 4 | import os | ||
| 5 | import sys | ||
| 6 | #import numpy as np | ||
| 7 | from tqdm import tqdm | ||
| 8 | |||
| 9 | print("Loading ASR model...") | ||
| 10 | providers = [ | ||
| 11 | "ROCMExecutionProvider", | ||
| 12 | #"CUDAExecutionProvider", | ||
| 13 | "CPUExecutionProvider", | ||
| 14 | ] | ||
| 15 | model = onnx_asr.load_model( | ||
| 16 | "nemo-parakeet-tdt-0.6b-v2", | ||
| 17 | providers=providers, | ||
| 18 | #quantization="int8" | ||
| 19 | ).with_timestamps() | ||
| 20 | |||
| 21 | # parakeet needs 16khz mono wav as input | ||
| 22 | input_file = "input.wav" | ||
| 23 | chunk_duration_seconds = 20 | ||
| 24 | sample_rate = 16000 | ||
| 25 | |||
| 26 | print(f"Loading and resampling {input_file}...") | ||
| 27 | try: | ||
| 28 | audio, sr = librosa.load(input_file, sr=sample_rate, mono=True) | ||
| 29 | except Exception as e: | ||
| 30 | print(f"Error loading audio file: {e}") | ||
| 31 | exit() | ||
| 32 | |||
| 33 | # process audio in chunks | ||
| 34 | chunk_size_samples = int(chunk_duration_seconds * sample_rate) | ||
| 35 | full_transcript = [] | ||
| 36 | temp_dir = "temp_chunks" | ||
| 37 | os.makedirs(temp_dir, exist_ok=True) | ||
| 38 | |||
| 39 | print("Starting transcription process in chunks...") | ||
| 40 | num_chunks = (len(audio) + chunk_size_samples - 1) // chunk_size_samples | ||
| 41 | |||
| 42 | for i in tqdm(range(num_chunks), desc="Transcribing"): | ||
| 43 | start_sample = i * chunk_size_samples | ||
| 44 | end_sample = start_sample + chunk_size_samples | ||
| 45 | chunk = audio[start_sample:end_sample] | ||
| 46 | |||
| 47 | temp_chunk_file = os.path.join(temp_dir, f"chunk_{i}.wav") | ||
| 48 | sf.write(temp_chunk_file, chunk, sample_rate) | ||
| 49 | |||
| 50 | try: | ||
| 51 | transcript = model.recognize(temp_chunk_file) | ||
| 52 | if transcript: | ||
| 53 | full_transcript.append(transcript) | ||
| 54 | except Exception as e: | ||
| 55 | print(f" Error processing chunk {i + 1}: {e}") | ||
| 56 | finally: | ||
| 57 | os.remove(temp_chunk_file) | ||
| 58 | |||
| 59 | os.rmdir(temp_dir) | ||
| 60 | |||
| 61 | print("\n" + "="*30) | ||
| 62 | print(" FINAL TRANSCRIPT") | ||
| 63 | print("="*30) | ||
| 64 | print(full_transcript) | ||
| 65 | |||
| 66 | # onnxruntime has some bug where it doesn't exit properly, aborting instead | ||
| 67 | # so hard exit instead (sys.exit does graceful exit) | ||
| 68 | os._exit(0) | ||
