A Xiaomi elindította az új MiMo V2.5 AI‑modelleket, amelyek lehetővé teszik a szöveg hanggá alakítását és fordítva
Xiaomi új hangalapú mesterséges intelligencia modelleket indít
A Xiaomi vállalat két verziót mutatott be hangos MI-modelleiről, amelyek szöveget és audiót dolgoznak fel:
Modell | Funkció | Főbb jellemzők
MiMo‑V2.5‑TTS
Szöveg → beszéd
3 variáns, ingyenes korlátozott időre a MiMo Studio-ban; sebesség, hangszín és érzelem beállítása; új hangok létrehozása rövid mondattal (VoiceDesign) és hang klónozása néhány mintából (VoiceClone).
MiMo‑V2.5‑ASR
Beszéd → szöveg
Káros körülmények között is felismeri a beszédet, támogatja a kínai dialektusokat + angolt; kétnyelvű párbeszédeket és dalszövegeket (vokal háttérzenénél); működik erős zaj mellett; automatikusan helyezi el a pontozást intonáció alapján.
Hogyan használjuk a MiMo‑V2.5‑TTS-t
1. Alapváltozat – kiválaszt egy előre beállított hangot, és lehetővé teszi a sebesség, hangszín és érzelmi árnyalat módosítását.
2. VoiceDesign – rövid mondat bevitele után a rendszer új hangtónust generál.
3. VoiceClone – tölt be néhány mintát egy adott hangból; a modell visszaadja azt stílus- és utasításmegőrzéssel.
A kívánt hangzás eléréséhez a felhasználó:
- Speciális tageket adhat a szöveghez;
- Egyszerű természetes nyelven írhat le egy hangot (kínai vagy angol);
- Forgatókönyveket készíthet virtuális előadásokhoz, ahol több hang egyszerre interakciózik.
MiMo‑V2.5‑ASR jellemzői
- Többnyelvűség – támogatja a kínai nyelv különböző dialektusait és az angolt.
- Dalszöveg dekódolása – a modell kiemeli a vokált még háttérzenével is.
- Zajállósság – pontos felismerés erős külső zajban.
- Intonáció szerinti pontozás – automatikusan beszúrja a írásjeleket, csökkentve a kézi javítás szükségességét.
Így a Xiaomi bővíti hangtechnológiai képességeit, rugalmas eszközöket kínálva a szintetizált beszéd létrehozásához és a verbális információ pontos felismeréséhez.
Hozzászólások (0)
Oszd meg a véleményed — kérjük, légy udvarias és maradj a témánál.
Jelentkezz be a hozzászóláshoz