LLMPruner:大语言模型裁剪工具。通过对大语言模型的冗余词表进行裁剪,减少模型参数量,降低显存占用,提升训练速度,并且能够保留预训练中学习到的知识。

大语言模型(LLM, Large Language Model)犹如雨后春笋般,其虽然效果惊艳,但参数量巨大,让普通玩家望而却步。 如今的大语言模型大多为多语种大预言模型(Multilingual Large Language Model),如LLaMA、mT5、Bloom等,其词表规模巨大,占据非常大部分的模型参数,如Bloom具有25万词表。 在训练模型时,词表权重将会消耗非常大的显存,降低训练速度,产生OOM的现象。

但在许多下游任务中,一般只会用到一两种语言,例如在中文场景中,一般只会用到中英文。 我们可以对大语言模型的词表进行裁剪,只留下所需的部分,这样不仅能够充分保留模型的预训练知识,并且能够使用更少的显卡进行下游任务的finetune,提升训练效率。 | #工具
如何评价 OpenAI 的超级对话模型 ChatGPT ? | 知乎问答
llama-node:Node.js运行的大语言模型LLaMA。这个项目处于早期阶段,nodejs的API可能会在未来发生变化,请谨慎使用。
hypergraphx:一个Python库,用于分析具有群体相互作用的现实复杂系统,提供了构建、可视化和分析超图的全面工具和算法

Docs | 教程 | repo
GPT-4 + Google搜索的命令行工具,结合最新搜索结果进行回答

GPT-4 with Search | #工具
chatgpt-sites:ChatGPT 在线体验网站收集列表

本仓库旨在搜集整理国内用户可访问的基于 OPENAI API 开发的在线应用列表

其主要来源为:

从网络手动搜集整理。
热心网友推荐或自荐。
程序自动抓取开源仓库信息。定时任务每日更新
More...

PS:已被禁用
将自然语言转换成shell命令的命令行工具

AI Shell | #工具
基于GPT AI模型的开源项目,可以根据给定的研究问题自动生成学术文献综述,可以从Semantic Scholar API中获取论文,提取相关信息,并将研究结果汇总成简明的文献综述 | AutoResearcher
一个 Chrome 扩展程序,利用 Meta 的 "Segment Anything",从图像中提取前景目标并将其复制到剪贴板

Magic Copy | #插件
如何自然地演讲 PPT,而不是念 PPT?| 知乎问答 | #经验
彭博社发布了一个专门针对金融领域的大语言模型:BloombergGPT,这是一个 500 亿参数的语言模型,它在广泛的金融数据上进行了训练。
腾讯云的轻量最近放宽了策略。之前实名认证过的,新注册个账号用同一身份认证还算首单 | Link
前端精读系列文章,每周更新

素材来源:周刊参考池

现已涵盖:
结合大厂工作经验解读的前沿技术源码解读
逐渐加入一些后端技术解读。
一些商业思考
已完成编译原理设计模式两大基础模块。

项目地址 | #前端
Back to Top