English

模型

共 73 个项目 · 第 1 / 1 页

第 1-73 条,共 73 个
01
vibevoice
微软开源的前沿语音大模型系列,提供流式语音合成与识别能力及CPU推理引擎和演示。
02
ChatTTS
面向日常对话场景的生成式语音合成模型,支持多说话人与细粒度韵律控制研究。
03
kronos
面向金融市场K线序列的基础模型家族,发布多规模预训练权重与分层离散化标记器体系。
04
voxcpm
免分词端到端多语种语音合成模型,支持三十种语言创意音色设计与高保真复刻及48kHz输出。
05
timesfm
谷歌预训练时间序列基础模型,面向多变量时序预测发布权重与评测基准。
06
unlimited-ocr
支持单次长视野文档解析的百度开源OCR大模型权重及其推理示例。
07
unilm
微软大规模自监督预训练研究合集,覆盖语言视觉语音及多模态基础模型,提供预训练代码与模型权重供研究复现。
08
Qwen
发布通义千问Qwen系列开源大语言模型权重,包含基座模型与对话模型及技术报告,供部署微调研究使用。
09
FinGPT
面向金融领域的开源大语言模型,提供指令微调模型权重、评测基准及情感分析和 robo 预测能力
10
DeepResearch
通义开源的300亿参数深度研究大模型,专注长程深度信息搜索,支持ReAct推理并在多项智能搜索基准上达到最优。
11
Chinese-LLaMA-Alpaca
开源中文LLaMA与Alpaca大模型权重,提供预训练、指令精调脚本及本地量化部署方案,促进中文大模型研究。
12
Janus
统一多模态理解与图像生成的自回归模型系列,解耦视觉编码,支持理解与文生图任务。
13
lingbot-map
面向流式数据三维重建的前馈3D基础模型,提供权重、论文与长序列推理实现。
14
kittentts
25MB级超轻量开源文本转语音模型库,CPU可跑并提供多音色语速控制能力
15
openmythos
重构Mythos架构的开源理论模型实现,含循环深度Transformer与稀疏混合专家结构。
16
RWKV-LM
RWKV系列大模型的官方实现仓库,提供RNN架构的训练与推理代码及模型权重,兼顾Transformer性能与线性时间推理效率。
17
CogVideo
智谱开源的文本图像生成视频大模型系列,提供CogVideoX权重、推理与微调代码以支持研究与部署。
18
ace-step-1.5
高效开源音乐生成基座模型,支持多语言歌词与风格控制的本地快速作曲。
19
HRM
提出分层推理模型HRM,仅27M参数用千样本在数独、迷宫及ARC推理基准上达到近完美表现的轻量通用推理模型。
20
MOSS
复旦开源的中英双语对话大模型,提供003系列权重、对话数据及推理微调代码,支持插件调用。
21
needle
面向手机穿戴家居机器人的超小基础模型,擅长工具调用与结构化抽取的端侧部署权重。
22
trellis.2
面向高保真图像生成3D资产的大规模生成模型,提供紧凑结构化隐变量与材质建模。
23
MiniCPM
面向端侧部署的轻量大语言模型系列,提供1B/2B等权重、训练配方与部署微调指南。
24
ltx-2
LTX-2音视频同步生成基座模型的官方推理包与LoRA训练代码发布。
25
kimi-k3
月之暗面发布的开放权重原生多模态前沿大模型,支持长上下文智能体任务的基座
26
longcat-video
美团长猫基础视频生成大模型,统一多任务高效生成分钟级长视频,性能对标开源与商业方案。
27
Qwen-Image
通义千问开源的200亿参数图像基础模型,擅长复杂文字渲染与精准图像编辑,支持文生图与图像编辑。
28
weathernext
谷歌DeepMind全球中期天气预报与气旋预测模型,含运行代码与预训练权重发布。
29
glm-5
智谱面向智能体任务的开源混合专家大模型系列,提供长上下文与编码能力。
30
Chinese-LLaMA-Alpaca-2
基于LLaMA-2的中文大模型二期项目,发布中文预训练、指令微调及64K超长上下文模型权重,供部署微调研究。
31
LLM4Decompile
专用于二进制反编译的开源大模型,提供多尺寸模型权重、训练脚本与评测基准,可将x86_64二进制还原为可读C代码。
32
sensenova-u1
统一多模态大模型权重系列,主打原生统一架构,支持图文生成编辑与4K生成能力。
33
neutts
开源端侧语音合成模型合集,支持瞬间音色克隆与多语言实时语音生成。
34
dflash
用于推测解码加速的轻量块扩散草稿模型,提供多模型家族权重与推理评测支持。
35
limix
面向结构化数据的通用基础模型权重发布,统一处理分类回归与缺失值填补任务。
36
qwen3.8
阿里Qwen团队发布的大语言模型权重系列,提供多尺寸开源权重、评测与推理部署指南。
37
moss-tts
覆盖长语音对话实时流式与音效的开源语音生成模型家族,提供多档权重与配套推理。
38
gpa
统一语音识别合成与声音转换的单体 tiny 模型权重发布,单模型实现多音频任务。
39
tabfm
面向混合类型表格数据零样本分类与回归的预训练表格基础模型权重。
40
moss-transcribe-diarize
零点九B长时多说话人转录与分离开源模型,支持五十余语种时间戳与声学事件感知。
41
joyai-echo
京东开源的长时音视频生成与可进入世界模型,支持10分钟以上多镜头连续生成与交互导航推理,供学术研究使用。
42
fireredaudio
集理解与生成一体的90亿参数通用音频语言模型,支持识别、问答、克隆配音与语音编辑及长音频对齐。
43
hunyuanocr
腾讯轻量端到端OCR视觉语言模型,聚焦更快更准的文档表格与场景文字识别能力。
44
joyai-video-edit
实时开放域视频编辑大模型,支持直播流逐帧因果编辑,720p达30FPS高吞吐。
45
lingbot-world-v2
交互式世界基础模型权重发布,支持高速视频流生成与智能体行为规划的具身交互研究。
46
fireredtts3
支持24语言与21种方言的统一语音生成编辑模型,可零样本克隆、按描述设计音色并做语义声学编辑。
47
wemm-embedding
微信视觉团队开源的通用多模态嵌入模型家族,统一表示文本图像视频与图文交错输入,在多项检索基准上达到最优。
48
mage
轻量多模态模型家族,含图像视频理解与文生图模型,发布权重供研究微调部署使用。
49
vibevoice
可生成长达数十分钟多说话人对话语音的开源TTS模型,提供多尺寸权重与微调推理代码。
50
dots.tts
两百亿参数端到端连续语音合成基础模型,发布预训练与蒸馏权重及推理微调代码。
51
llava-onevision-2
完全开放的多模态大模型框架,统一图像长视频与空间理解并发布模型数据与训练全流程。
52
giga-world-1
面向机器人策略评估的世界模型路线图项目,开放训练推理流程、模型权重与数据集及评测榜单。
53
orca
基于下一状态预测的世界基础模型,从视频语言学习统一世界隐表示。
54
vlx-seek
面向具身边缘视觉的细粒度感知多模态模型,实现目标定位与缺失拒绝的开放世界理解。
55
qwen-agentworld
覆盖七大智能体交互域的原生语言世界模型权重发布,配套跨域仿真评测基准与技术报告。
56
hulu-med
面向医疗文本二维三维影像与手术视频的透明通用视觉语言大模型,公开权重并刷新多项基准。
57
boogu-image
开源统一图像生成编辑模型族,提供基座极速与编辑变体权重,支持中英文高质量文本渲染生成。
58
lingbot-vision
面向密集空间感知的自监督视觉Transformer骨干家族,提供从小到1.1B参数的预训练权重。
59
lingbot-video
面向具身智能的大规模混合专家视频生成开源模型权重系列。
60
lingbot-vla-v2
面向机器人操作的视觉语言动作基础模型权重发布,支持多构型机械臂任务泛化执行。
61
minimax-music3
基于混合层级大模型的长时长音乐生成模型,可根据歌词与描述生成五分钟完整歌曲权重发布。
62
alayaworld
可交互长时域视频世界模型,支持实时相机控制与提示词切换,并开源权重与训练推理代码。
63
hy-embodied
面向真实世界具身智能体的高效混合专家基础模型权重,兼顾物理理解与推理效率。
64
krea-2
Krea 2美学开源生图模型官方推理仓,提供RAW基座与Turbo蒸馏版双权重及高分辨率推理示例。
65
dreamx-world
通用交互式世界模型权重发布,可生成高保真可探索可控制的动态世界视频。
66
sensenova-vision
统一多模态生成视觉模型,发布权重数据集与训推代码,用于结构化理解与稠密几何预测研究。
67
hy3
腾讯混元295B MoE推理与智能体大模型权重发布,主打高性价比,在多项生产任务上比肩更大旗舰模型。
68
tau-0-vla
面向长时程操作的分层机器人基础模型权重与训练部署实现,提供世界模型引导的测试时推理能力。
69
helixworld
可交互漫游的实时音画世界模型,输入图像提示即可联动生成视角与空间音频。
70
lavasr
轻量高速的语音修复增强模型,提供权重与推理的开源模型发布。
71
mira
可实时交互的火箭联盟多人世界模型,逐帧生成四视角对局视频的大参数扩散模型。
72
llada2.x
大规模扩散语言模型系列权重发布,覆盖多尺寸版本与高效并行推理优化。
73
anigen
单图生成可绑定动画3D资产的统一场模型,支持骨骼蒙皮与动作驱动。