实时数据在数据分析和应用开发中越来越关键,但找到高质量、公开且实时更新的数据源并不容易。

bytewax 整理了一份非常全面的公开实时数据集和数据源清单,涵盖金融、区块链、交通、天气、物联网、安全、新闻等多个领域,既有免费的也有付费的,支持通过 HTTP 或 WebSocket 等方式访问。

这份资源对数据科学家、开发者和研究人员极具价值,方便快速接入和使用实时数据,加速数据驱动的应用开发和研究。

主要内容包括:

- 金融市场实时行情与区块链交易数据源,如 Coinbase、Binance、 Polygon.io 等;
- 交通运输实时数据,包括英国铁路、纽约公交、瑞士公共交通等;
- 天气和环境监测数据,如 NOAA、Open Weather API、EPA 空气质量数据;
- 网络安全实时威胁情报和证书透明度日志;
- 新闻实时聚合和事件流,涵盖多家主流媒体和技术社区;
- 物联网传感器实时数据渠道及卫星轨迹追踪;
- 还包括多种付费优质数据服务,满足专业需求。

Awesome Public Real-Time Datasets and Sources | #数据集
SoundMind 推出首个面向复杂推理的音频逻辑推理(ALR)数据集,涵盖6,446个音频与文本双模态链式思维注释样本,推动音频语言模型突破传统边界。| #数据集

• 创新点:基于规则的强化学习算法,专为赋能大规模音频语言模型实现深度双模态逻辑推理设计。
• 数据规模:6,446条高质量标注,涵盖训练、测试、验证集,支持链式思维推理,提升模型理解复杂语义的能力。
• 技术细节:依赖 Verl 框架,推荐8×NVIDIA H800/H100 80GB GPU,Python ≥3.9,CUDA≥12.1,确保高效训练与推理。
• 实用工具:提供多种数据预处理脚本,支持仅文本、仅音频或双模态输入,灵活适配各类研究需求。
• 开源透明:MIT许可协议,代码、数据集与模型权重均公开,便于复现与二次开发。
• 研究价值:打破单一模态推理瓶颈,强化音频与文本的逻辑联结,推动音频语言理解迈入新阶段。
TexVerse:一个涵盖超85万高质量3D模型及高分辨率材质的大型开放数据集,专为视觉计算、图形学研究与应用打造。| #数据集

• 数据规模:858,669个独特3D模型,包含158,518个基于物理渲染(PBR)材质模型,支持2K、4K、8K超高清纹理。
• 多样变体:每个模型含所有高分辨率变体,累计1,659,097个3D实例,满足细粒度需求。
• 动画与骨骼:专门子集包含69,138个绑定骨骼模型与54,430个动画模型,保留用户原始文件格式,确保骨骼与动画完整性。
• 细致标注:涵盖整体特征、结构组件及精细特征,便于深入分析与训练。
• 开放授权:所有模型均采用Creative Commons许可,支持广泛共享与再利用。
• 下载方式:高分辨率纹理集中托管于TexVerse,1K纹理另有独立资源,动画与骨骼数据联合托管,资源详见metadata文件。

TexVerse为三维内容创作与AI视觉应用提供了坚实数据基础,是推动高精度3D理解与生成的宝贵资源。
LAB-Bench:面向生物科学研究的 AI 能力基准评测数据集,助力科学智能的系统化验证与提升。| #数据集

• 覆盖8大类30个细分任务,涵盖文献抽取(LitQA2)、数据库检索(DbQA)、补充信息(SuppQA)、科学图表推理(FigQA/TableQA)、实验协议排错(ProtocolQA)、生物序列操作(SeqQA)及分子克隆复杂场景。
• 公开约80%数据,保留20%私有测试集防止训练污染,内置canary字符串便于模型训练过滤。
• 支持Python 3.10+,提供异步agent接口,便于并行评测与多模型对比。
• 详尽文档和示例代码包含多种基线测试,助力快速上手与复现。
• 数据集开放获取,支持Hugging Face平台同步调用,推动AI在生物研究中的实用转化。
• 论文详述数据集设计与评测方法,具备长期参考价值,为科研AI能力构建提供方法论支撑。
一个大规模、高难度、去污染且可验证的数学数据集,助力数学推理能力的提升。

包含103,000道高难度数学题目,难度主要集中在5-9级;覆盖广泛的数学主题,包括代数、微积分、数论、几何、概率和离散数学;经过严格去污染处理,确保数据纯净,避免测试集泄露

DeepMath | #数据集
覆盖全球的多模态时空数据集,为研究地球环境变化提供丰富资源,支持跨学科分析

NeurIPS24-Terra | #数据集
音频效果研究数据库,提供科学文献资源,特色在于使用Notion™️动态表格的可视化,支持过滤、排序和标签功能,便于更新和管理音频效果相关文献

AFX-Research | #数据库
持续更新的中文指令微调数据集,支持双语微调和数据修正。

本数据集包括中文和英文的混合数据集,方便双语微调,以及后续做持续的数据修正。

原始的Alpaca英文数据集也存在不少的问题,个别的数学类的sample是错的,有少部分output字段需要修正,一些的标签没有对齐等。本数据集会对原始的数据集进行修改和修正。再此基础上,翻译出对应的中文版本,中文版基本是原始sample的翻译,但是对于一些比如押韵类、时态类的一些instruction,直接翻译导致韵脚丢失,时态不一致等。需要对应的进行人工改写。主要分为以下几个方面:

修改原始英文数据集的一些问题
翻译为中文数据集
调整直译导致的一些sample
code等一些特殊的输出不进行翻译
对齐一些特殊的标签 或者拒绝生成等输出

Alpaca中文指令微调数据集 | #数据集
关于学习数据科学的新版路线图,包括深入学习Python编程语言,统计学,数据库,机器学习,深度学习,自然语言处理以及MLOPS(机器学习运维),提供了广泛的学习资源和实际项目实践,是学习数据科学的理想指南。

Perfect Roadmap To Learn Data Science In 2024 | #数据科学 #路线图
HISTORICAL PHOTOGRAPHS OF CHINA (中国历史照片)| #历史 #数据库

它是由布里斯托大学开放的关于中国影像的数据库,网站免费提供 20000 多张中国近代照片,能够看到许多有趣的照片。
美国国家科学院在线数据库 | #数据库

超一万本书籍免费下载和阅读,包含科学、工程和健康卫生等领域著作。

美国国家科学院出版社 (NAP) 出版美国国家科学院、工程院和医学院的出版物。NAP 每年出版 200 多篇出版物,涉及科学、工程和医学领域的广泛主题,提供有关科学和卫生政策重要问题的权威、独立研究的信息。
OpenWebMath:包含互联网上大部分高质量数学文本的数据集,从 Common Crawl 的超过 2000 亿 HTML 文件中过滤并提取出包含 147 亿 Token 的 630 万份文档,OpenWebMath 旨在用于预训练和微调大型语言模型 | #数据集
数据科学项目模板,重点是易复现和易维护

该模板允许你:

给你的项目创建一个可读的结构
提交代码时自动运行测试
在运行时强制执行类型提示
提交前检查代码中的问题
有效地管理项目中的依赖关系
为可重复的任务创建简短易读的命令
仅重新运行管道的修改组件
自动记录你的代码
观察并自动化你的代码

项目地址 | #模板 #数据科学
一个用于传输中的嵌套、非结构化、多模态数据的库,包括文本、图像、音频、视频、3D 网格等。它允许深度学习工程师使用 Pythonic API 高效地处理、嵌入、搜索、推荐、存储和传输多模态数据。

🚪 跨/多模态世界的大门:用于表示复杂/混合/嵌套文本、图像、视频、音频、3D 网格数据的超表现力数据结构。吉娜的基础数据结构,CLIP-即服务,DALL·E流,迪斯科艺术等

🧑‍🔬 数据科学强国:通过CPU/GPU上的Torch/TensorFlow/ONNX/PaddlePaddle,大大加快数据科学家在嵌入、k-NN匹配、查询、可视化和评估方面的工作。

🚡 传输中的数据:针对网络通信进行了优化,随时可以在线连接,在 Protobuf、bytes、base64、JSON、CSV、DataFrame 中进行快速和压缩的序列化。非常适合流式传输和内存不足数据。

🔎 一站式k-NN:主流矢量数据库的统一一致的API,允许最近的邻居搜索,包括Elasticsearch,Redis,ANNLite,Qdrant,Weaviate。

👒 对于现代应用程序:GraphQL 支持使您的服务器在请求和响应时具有多功能性;内置的数据验证和 JSON 架构 (OpenAPI) 可帮助您构建可靠的 Web 服务。

🐍 Pythonic 体验:设计得像 Python 列表一样简单。如果你知道如何Python,你就知道如何DocArray。直观的习语和类型注释简化了您编写的代码。

🛸 与IDE集成:在Jupyter笔记本和Google Colab上实现漂亮的打印和可视化;PyCharm & VS Code 中的全面自动完成和类型提示。

DocArray由三个简单的概念组成:

文档:一种数据结构,用于轻松表示嵌套的非结构化数据。
DocumentArray:用于高效访问、操作和理解多个文档的容器。
数据类:用于直观地表示多模态数据的高级 API。

DocArray | #数据库
一个稳定、快速、内嵌的 NoSQL 数据库,支持多种数据结构,包含 String、List、Hash、Set、Sorted Set。类似于 Redis,但是可以选择将 value 存储到磁盘中。

这也是个教学项目,在b站有教学《使用 Go 写一个数据库》 系列视频,共6期 ​​​

主要特性:

兼容 Redis 协议
支持丰富的数据结构,包含 String、List、Hash、Set、Sorted Set
内嵌使用,维护成本低
高性能,对读写负载的应用都适合
数据不局限于内存容量

项目地址 | #数据库
面向人脸识别的百万人脸图像数据集

DigiFace-1M数据集是100多万张用于人脸识别的不同合成人脸图像的集合。

它在我们的论文《DigiFace-1M: 1 Million Digital Face Images for Face Recognition》中被介绍,可用于训练面部识别的深度学习模型。

该数据集包含:

720K的图像,10K的身份(每个身份72张图像)。对于每个身份,有4组不同的配件被采样,每组有18张图像被渲染。
500K的图像,100K的身份(每个身份5张图像)。对于每个身份,只有一套配件被取样。
DigiFace-1M数据集可用于非商业研究,并根据LICENSE中的许可进行授权。

DigiFace-1M Dataset | #数据集
 
 
Back to Top