大家好,我们上了一个开源端到端语音大模型Step-Audio 2 mini ,该模型在多个际基准测试集上取得最佳成绩。
它将语音理解、音频推理与生成统一建模,在音频理解、语音识别、跨语种翻译、情感与副语言解析、语音对话等任务中表现突出,并率先支持语音原生的 Tool Calling 能力,可实现联网搜索等操作。
GitHub: https://github.com/stepfun-ai/Step-Audio2
Hugging Face: https://huggingface.co/stepfun-ai/Step-Audio-2-mini
1 bigtear 38 天前 开放权重就是好模型,顶 |
![]() | 2 byc4i 38 天前 能贴一下微信吗?微信群超 200 了不能扫码 |
3 closedevice 34 天前 赞,晚点就研究下,有相关论文么? |
![]() | 4 hzwer OP @closedevice 嗯,主页有 arxiv |