Automatic Speech Recognition
Core ML
NeMo
Dutch
coremltools
asr
speech
parakeet
yuriyvnv
4bit-palettize-kmeans
Instructions to use OpenVoiceOS/parakeet-tdt-0.6b-dutch-coreml-4bit with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- NeMo
How to use OpenVoiceOS/parakeet-tdt-0.6b-dutch-coreml-4bit with NeMo:
import nemo.collections.asr as nemo_asr asr_model = nemo_asr.models.ASRModel.from_pretrained("OpenVoiceOS/parakeet-tdt-0.6b-dutch-coreml-4bit") transcriptions = asr_model.transcribe(["file.wav"]) - Notebooks
- Google Colab
- Kaggle
Upload folder using huggingface_hub
Browse files- README.md +59 -0
- metadata.json +121 -0
- parakeet_decoder.mlpackage/Data/com.apple.CoreML/model.mlmodel +3 -0
- parakeet_decoder.mlpackage/Data/com.apple.CoreML/weights/weight.bin +3 -0
- parakeet_decoder.mlpackage/Manifest.json +18 -0
- parakeet_joint_decision_single_step.mlpackage/Data/com.apple.CoreML/model.mlmodel +3 -0
- parakeet_joint_decision_single_step.mlpackage/Data/com.apple.CoreML/weights/weight.bin +3 -0
- parakeet_joint_decision_single_step.mlpackage/Manifest.json +18 -0
- parakeet_mel_encoder.mlpackage/Data/com.apple.CoreML/model.mlmodel +3 -0
- parakeet_mel_encoder.mlpackage/Data/com.apple.CoreML/weights/weight.bin +3 -0
- parakeet_mel_encoder.mlpackage/Manifest.json +18 -0
- quantization_summary.json +17 -0
- vocab.json +0 -0
README.md
ADDED
|
@@ -0,0 +1,59 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
---
|
| 2 |
+
license: apache-2.0
|
| 3 |
+
language:
|
| 4 |
+
- nl
|
| 5 |
+
tags:
|
| 6 |
+
- asr
|
| 7 |
+
- speech
|
| 8 |
+
- coreml
|
| 9 |
+
- nemo
|
| 10 |
+
- parakeet
|
| 11 |
+
- yuriyvnv
|
| 12 |
+
- 4bit-palettize-kmeans
|
| 13 |
+
library_name: coremltools
|
| 14 |
+
pipeline_tag: automatic-speech-recognition
|
| 15 |
+
base_model: yuriyvnv/parakeet-tdt-0.6b-dutch
|
| 16 |
+
---
|
| 17 |
+
|
| 18 |
+
# parakeet-tdt-0.6b-dutch-coreml-4bit
|
| 19 |
+
|
| 20 |
+
CoreML conversion of [yuriyvnv/parakeet-tdt-0.6b-dutch](https://huggingface.co/yuriyvnv/parakeet-tdt-0.6b-dutch) — 4BIT PALETTIZE KMEANS quantized.
|
| 21 |
+
|
| 22 |
+
| | |
|
| 23 |
+
|---|---|
|
| 24 |
+
| **Architecture** | TDT (Token-and-Duration Transducer) |
|
| 25 |
+
| **Language** | Dutch |
|
| 26 |
+
| **Sample rate** | 16000 Hz |
|
| 27 |
+
| **Max audio** | 15.0s |
|
| 28 |
+
| **Vocab size** | 8192 |
|
| 29 |
+
| **Framework** | NVIDIA NeMo → CoreML (coremltools) |
|
| 30 |
+
|
| 31 |
+
## Components
|
| 32 |
+
|
| 33 |
+
| File | Component | Best compute |
|
| 34 |
+
|------|-----------|--------------|
|
| 35 |
+
| `parakeet_mel_encoder.mlpackage` | mel_encoder | ANE / GPU |
|
| 36 |
+
| `parakeet_decoder.mlpackage` | decoder | CPU only |
|
| 37 |
+
| `parakeet_joint_decision_single_step.mlpackage` | joint_decision_single_step | ANE / GPU |
|
| 38 |
+
|
| 39 |
+
## Usage
|
| 40 |
+
|
| 41 |
+
```bash
|
| 42 |
+
pip install ovos-stt-plugin-coreml
|
| 43 |
+
```
|
| 44 |
+
|
| 45 |
+
```python
|
| 46 |
+
from ovos_stt_plugin_coreml import CoremlSTT
|
| 47 |
+
from ovos_plugin_manager.utils.audio import AudioFile
|
| 48 |
+
|
| 49 |
+
stt = CoremlSTT(config={"metadata": "metadata.json"})
|
| 50 |
+
|
| 51 |
+
with AudioFile("speech.wav") as f:
|
| 52 |
+
audio = f.read()
|
| 53 |
+
print(stt.execute(audio))
|
| 54 |
+
```
|
| 55 |
+
|
| 56 |
+
## Source model
|
| 57 |
+
|
| 58 |
+
[yuriyvnv/parakeet-tdt-0.6b-dutch](https://huggingface.co/yuriyvnv/parakeet-tdt-0.6b-dutch)
|
| 59 |
+
|
metadata.json
ADDED
|
@@ -0,0 +1,121 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"model_id": "yuriyvnv/parakeet-tdt-0.6b-dutch",
|
| 3 |
+
"model_type": "parakeet_tdt_rnnt",
|
| 4 |
+
"language": "nl",
|
| 5 |
+
"sample_rate": 16000,
|
| 6 |
+
"max_audio_seconds": 15.0,
|
| 7 |
+
"max_audio_samples": 240000,
|
| 8 |
+
"vocab_size": 8192,
|
| 9 |
+
"blank_id": 8192,
|
| 10 |
+
"checkpoint": {
|
| 11 |
+
"type": "pretrained",
|
| 12 |
+
"model_id": "yuriyvnv/parakeet-tdt-0.6b-dutch"
|
| 13 |
+
},
|
| 14 |
+
"coreml": {
|
| 15 |
+
"compute_precision": "FLOAT32",
|
| 16 |
+
"quantization": "4bit_palettize_kmeans"
|
| 17 |
+
},
|
| 18 |
+
"components": {
|
| 19 |
+
"mel_encoder": {
|
| 20 |
+
"path": "parakeet_mel_encoder.mlpackage",
|
| 21 |
+
"inputs": {
|
| 22 |
+
"audio_signal": [
|
| 23 |
+
1,
|
| 24 |
+
240000
|
| 25 |
+
],
|
| 26 |
+
"audio_length": [
|
| 27 |
+
1
|
| 28 |
+
]
|
| 29 |
+
},
|
| 30 |
+
"outputs": {
|
| 31 |
+
"encoder": [
|
| 32 |
+
1,
|
| 33 |
+
1024,
|
| 34 |
+
188
|
| 35 |
+
],
|
| 36 |
+
"encoder_length": [
|
| 37 |
+
1
|
| 38 |
+
]
|
| 39 |
+
}
|
| 40 |
+
},
|
| 41 |
+
"decoder": {
|
| 42 |
+
"path": "parakeet_decoder.mlpackage",
|
| 43 |
+
"inputs": {
|
| 44 |
+
"targets": [
|
| 45 |
+
1,
|
| 46 |
+
1
|
| 47 |
+
],
|
| 48 |
+
"target_length": [
|
| 49 |
+
1
|
| 50 |
+
],
|
| 51 |
+
"h_in": [
|
| 52 |
+
2,
|
| 53 |
+
1,
|
| 54 |
+
640
|
| 55 |
+
],
|
| 56 |
+
"c_in": [
|
| 57 |
+
2,
|
| 58 |
+
1,
|
| 59 |
+
640
|
| 60 |
+
]
|
| 61 |
+
},
|
| 62 |
+
"outputs": {
|
| 63 |
+
"decoder": [
|
| 64 |
+
1,
|
| 65 |
+
640,
|
| 66 |
+
1
|
| 67 |
+
],
|
| 68 |
+
"h_out": [
|
| 69 |
+
2,
|
| 70 |
+
1,
|
| 71 |
+
640
|
| 72 |
+
],
|
| 73 |
+
"c_out": [
|
| 74 |
+
2,
|
| 75 |
+
1,
|
| 76 |
+
640
|
| 77 |
+
]
|
| 78 |
+
}
|
| 79 |
+
},
|
| 80 |
+
"joint_decision_single_step": {
|
| 81 |
+
"path": "parakeet_joint_decision_single_step.mlpackage",
|
| 82 |
+
"inputs": {
|
| 83 |
+
"encoder_step": [
|
| 84 |
+
1,
|
| 85 |
+
1024,
|
| 86 |
+
1
|
| 87 |
+
],
|
| 88 |
+
"decoder_step": [
|
| 89 |
+
1,
|
| 90 |
+
640,
|
| 91 |
+
1
|
| 92 |
+
]
|
| 93 |
+
},
|
| 94 |
+
"outputs": {
|
| 95 |
+
"token_id": [
|
| 96 |
+
1,
|
| 97 |
+
1,
|
| 98 |
+
1
|
| 99 |
+
],
|
| 100 |
+
"token_prob": [
|
| 101 |
+
1,
|
| 102 |
+
1,
|
| 103 |
+
1
|
| 104 |
+
],
|
| 105 |
+
"duration": [
|
| 106 |
+
1,
|
| 107 |
+
1,
|
| 108 |
+
1
|
| 109 |
+
]
|
| 110 |
+
}
|
| 111 |
+
}
|
| 112 |
+
},
|
| 113 |
+
"joint_extra_outputs": 5,
|
| 114 |
+
"duration_bins": [
|
| 115 |
+
0,
|
| 116 |
+
1,
|
| 117 |
+
2,
|
| 118 |
+
3,
|
| 119 |
+
4
|
| 120 |
+
]
|
| 121 |
+
}
|
parakeet_decoder.mlpackage/Data/com.apple.CoreML/model.mlmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:9f9cb0ce2251e781044b1c50054f6ce17148d5a2822f5ac42d5ff8f66821a191
|
| 3 |
+
size 13061
|
parakeet_decoder.mlpackage/Data/com.apple.CoreML/weights/weight.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:560e02c955e3dc254196c8bcd5a6b80db040b24b7d593ff2be09e64061c3bef0
|
| 3 |
+
size 5909952
|
parakeet_decoder.mlpackage/Manifest.json
ADDED
|
@@ -0,0 +1,18 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"fileFormatVersion": "1.0.0",
|
| 3 |
+
"itemInfoEntries": {
|
| 4 |
+
"3D927FED-5249-4512-91E5-AA60DBB4A00B": {
|
| 5 |
+
"author": "com.apple.CoreML",
|
| 6 |
+
"description": "CoreML Model Weights",
|
| 7 |
+
"name": "weights",
|
| 8 |
+
"path": "com.apple.CoreML/weights"
|
| 9 |
+
},
|
| 10 |
+
"CC903519-4F15-40D6-95E8-053620A30E86": {
|
| 11 |
+
"author": "com.apple.CoreML",
|
| 12 |
+
"description": "CoreML Model Specification",
|
| 13 |
+
"name": "model.mlmodel",
|
| 14 |
+
"path": "com.apple.CoreML/model.mlmodel"
|
| 15 |
+
}
|
| 16 |
+
},
|
| 17 |
+
"rootModelIdentifier": "CC903519-4F15-40D6-95E8-053620A30E86"
|
| 18 |
+
}
|
parakeet_joint_decision_single_step.mlpackage/Data/com.apple.CoreML/model.mlmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d450bff77133f085758e75cb31f647833e6d3badd6ebdc6fc4457319dfea2c61
|
| 3 |
+
size 8906
|
parakeet_joint_decision_single_step.mlpackage/Data/com.apple.CoreML/weights/weight.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:4ef3a3360b1f73436ed0c15d0918c80e27ad37e4315168caae0b04797b34fd69
|
| 3 |
+
size 3175628
|
parakeet_joint_decision_single_step.mlpackage/Manifest.json
ADDED
|
@@ -0,0 +1,18 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"fileFormatVersion": "1.0.0",
|
| 3 |
+
"itemInfoEntries": {
|
| 4 |
+
"E4F159F9-0F23-4089-A6CF-61015B7B7576": {
|
| 5 |
+
"author": "com.apple.CoreML",
|
| 6 |
+
"description": "CoreML Model Specification",
|
| 7 |
+
"name": "model.mlmodel",
|
| 8 |
+
"path": "com.apple.CoreML/model.mlmodel"
|
| 9 |
+
},
|
| 10 |
+
"F994A227-F072-4E5A-8E07-2AF24816294D": {
|
| 11 |
+
"author": "com.apple.CoreML",
|
| 12 |
+
"description": "CoreML Model Weights",
|
| 13 |
+
"name": "weights",
|
| 14 |
+
"path": "com.apple.CoreML/weights"
|
| 15 |
+
}
|
| 16 |
+
},
|
| 17 |
+
"rootModelIdentifier": "E4F159F9-0F23-4089-A6CF-61015B7B7576"
|
| 18 |
+
}
|
parakeet_mel_encoder.mlpackage/Data/com.apple.CoreML/model.mlmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:f47427b2927165c27e47fee4ebf7c8a30cc730b3d56f43e9191e24e4b4f80b42
|
| 3 |
+
size 694501
|
parakeet_mel_encoder.mlpackage/Data/com.apple.CoreML/weights/weight.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:ed1f384cf1f539d6250f40a2f6caa1602a37e06f4bbdfa79e81764ec4fae34ec
|
| 3 |
+
size 297267392
|
parakeet_mel_encoder.mlpackage/Manifest.json
ADDED
|
@@ -0,0 +1,18 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"fileFormatVersion": "1.0.0",
|
| 3 |
+
"itemInfoEntries": {
|
| 4 |
+
"4E21D5FD-6688-43A1-A8B7-E659B7B08732": {
|
| 5 |
+
"author": "com.apple.CoreML",
|
| 6 |
+
"description": "CoreML Model Specification",
|
| 7 |
+
"name": "model.mlmodel",
|
| 8 |
+
"path": "com.apple.CoreML/model.mlmodel"
|
| 9 |
+
},
|
| 10 |
+
"8B1CB281-BF50-40D9-85E1-FDA3ECD00D23": {
|
| 11 |
+
"author": "com.apple.CoreML",
|
| 12 |
+
"description": "CoreML Model Weights",
|
| 13 |
+
"name": "weights",
|
| 14 |
+
"path": "com.apple.CoreML/weights"
|
| 15 |
+
}
|
| 16 |
+
},
|
| 17 |
+
"rootModelIdentifier": "4E21D5FD-6688-43A1-A8B7-E659B7B08732"
|
| 18 |
+
}
|
quantization_summary.json
ADDED
|
@@ -0,0 +1,17 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"parakeet_decoder": {
|
| 3 |
+
"original_mb": 22.5,
|
| 4 |
+
"4bit_mb": 5.6,
|
| 5 |
+
"compression": 3.99
|
| 6 |
+
},
|
| 7 |
+
"parakeet_joint_decision_single_step": {
|
| 8 |
+
"original_mb": 12.1,
|
| 9 |
+
"4bit_mb": 3.0,
|
| 10 |
+
"compression": 3.97
|
| 11 |
+
},
|
| 12 |
+
"parakeet_mel_encoder": {
|
| 13 |
+
"original_mb": 1132.5,
|
| 14 |
+
"4bit_mb": 284.2,
|
| 15 |
+
"compression": 3.99
|
| 16 |
+
}
|
| 17 |
+
}
|
vocab.json
ADDED
|
The diff for this file is too large to render.
See raw diff
|
|
|