前往小程序,Get更优阅读体验!
立即前往
首页
学习
活动
专区
工具
TVP
发布
社区首页 >专栏 >国内 huggingface 镜像——帮助 AI 开发者快速稳定的下载模型数据集

国内 huggingface 镜像——帮助 AI 开发者快速稳定的下载模型数据集

作者头像
轩源
发布2024-09-29 20:48:49
1160
发布2024-09-29 20:48:49
举报
文章被收录于专栏:轩源的网络日志

方法一:huggingface-cli

huggingface-cli 是 Hugging Face 官方提供的命令行工具,自带完善的下载功能。

1. 安装依赖

代码语言:javascript
复制
pip install -U huggingface_hubCopy

2. 设置环境变量 Linux

代码语言:javascript
复制
export HF_ENDPOINT=https://hf-mirror.comCopy

Windows Powershell

代码语言:javascript
复制
$env:HF_ENDPOINT = "https://hf-mirror.com"Copy

建议将上面这一行写入 ~/.bashrc3.1 下载模型

代码语言:javascript
复制
huggingface-cli download --resume-download gpt2 --local-dir gpt2Copy

3.2 下载数据集

代码语言:javascript
复制
huggingface-cli download --repo-type dataset --resume-download wikitext --local-dir wikitextCopy

可以添加 --local-dir-use-symlinks False 参数禁用文件软链接,这样下载路径下所见即所得,详细解释请见上面提到的教程。

方法二:使用 hfd

hfd 是 huggingface 专用下载工具,基于成熟工具 git+aria2,可以做到稳定下载不断线。

1. 下载hfd

代码语言:javascript
复制
wget https://hf-mirror.com/hfd/hfd.shchmod a+x hfd.shCopy

2. 设置环境变量 Linux

代码语言:javascript
复制
export HF_ENDPOINT=https://hf-mirror.comCopy

Windows Powershell

代码语言:javascript
复制
$env:HF_ENDPOINT = "https://hf-mirror.com"Copy

3.1 下载模型

代码语言:javascript
复制
./hfd.sh gpt2 --tool aria2c -x 4Copy

3.2 下载数据集

代码语言:javascript
复制
./hfd.sh wikitext --dataset --tool aria2c -x 4Copy

方法三:使用环境变量(非侵入式)

非侵入式,能解决大部分情况。huggingface 工具链会获取HF_ENDPOINT环境变量来确定下载文件所用的网址,所以可以使用通过设置变量来解决。

代码语言:javascript
复制
HF_ENDPOINT=https://hf-mirror.com python your_script.pyCopy

不过有些数据集有内置的下载脚本,那就需要手动改一下脚本内的地址来实现了。

常见问题

Q: 有些项目需要登录,如何下载?

A:部分 Gated Repo 需登录申请许可。为保障账号安全,本站不支持登录,需先前往 Hugging Face 官网登录、申请许可,在官网这里获取 Access Token 后回镜像站用命令行下载。 部分工具下载 Gated Repo 的方法:huggingface-cli: 添加--token参数

代码语言:javascript
复制
huggingface-cli download --token hf_*** --resume-download meta-llama/Llama-2-7b-hf --local-dir Llama-2-7b-hfCopy

hfd: 添加--hf_username--hf_token参数

代码语言:javascript
复制
hfd meta-llama/Llama-2-7b --hf_username YOUR_HF_USERNAME --hf_token hf_***Copy

其余如from_pretrainedwgetcurl如何设置认证 token,详见上面第一段提到的教程。

本文参与 腾讯云自媒体同步曝光计划,分享自作者个人站点/博客。
如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 作者个人站点/博客 前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 方法一:huggingface-cli
  • 方法二:使用 hfd
  • 方法三:使用环境变量(非侵入式)
  • 常见问题
    • Q: 有些项目需要登录,如何下载?
    相关产品与服务
    命令行工具
    腾讯云命令行工具 TCCLI 是管理腾讯云资源的统一工具。使用腾讯云命令行工具,您可以快速调用腾讯云 API 来管理您的腾讯云资源。此外,您还可以基于腾讯云的命令行工具来做自动化和脚本处理,以更多样的方式进行组合和重用。
    领券
    问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档