[{"@type":"PropertyValue","name":"Data content","value":"Contains various types of large model instructions for fine-tuning data"},{"@type":"PropertyValue","name":"Data volume","value":"100000"},{"@type":"PropertyValue","name":"Format","value":"Json"},{"@type":"PropertyValue","name":"Language","value":"English"}]
{"id":1814,"datatype":"1","titleimg":"https://www.nexdata.ai/shujutang/static/image/index/datatang_tuxiang_default.webp","type1":"226","type1str":null,"type2":"228","type2str":null,"dataname":"100K English Instruction Tuning Dataset – General Domain SFT for LLM Fine-Tuning","datazy":[{"title":"Data content","content":"Contains various types of large model instructions for fine-tuning data"},{"title":"Data volume","content":"100000"},{"title":"Format","content":"Json"},{"title":"Language","content":"English"}],"datatag":"sft","technologydoc":null,"downurl":null,"datainfo":null,"standard":null,"dataylurl":null,"flag":null,"publishtime":null,"createby":null,"createtime":null,"ext1":null,"samplestoreloc":null,"hosturl":null,"datasize":null,"industryPlan":null,"keyInformation":null,"samplePresentation":[{"name":"微信截图_20250709171747.png","url":"https://storage-product.datatang.com/damp/product/samplePresentation_ipad/20250709165948/%E5%BE%AE%E4%BF%A1%E6%88%AA%E5%9B%BE_20250709171747.png?Expires=4102415999&OSSAccessKeyId=LTAI5tEBeSWUJiqjXvBMsxEu&Signature=kA3ceIhBDtVVnSRK07xKZI0Q9eM%3D","intro":"","size":128391,"progress":100,"type":"jpg"},{"name":"微信截图_20250709171727.png","url":"https://storage-product.datatang.com/damp/product/samplePresentation_ipad/20250709165948/%E5%BE%AE%E4%BF%A1%E6%88%AA%E5%9B%BE_20250709171727.png?Expires=4102415999&OSSAccessKeyId=LTAI5tEBeSWUJiqjXvBMsxEu&Signature=O7UM48Q7RGQizJhBkv3o6CKaWFI%3D","intro":"","size":144086,"progress":100,"type":"jpg"}],"officialSummary":"100,000 Fine-Tuning Text Dataset for English LLM General Domain SFT is a high-quality supervised fine-tuning corpus designed to optimize instruction-following capabilities in large language models. Each data point is double-verified by experienced linguistic professionals and AI engineers to ensure relevance, clarity, and effectiveness in improving model alignment and response precision. The dataset supports instruction tuning tasks across a wide range of general knowledge domains and is compatible with leading open-source LLMs such as LLaMA, Falcon, GPT-NeoX, and Mistral. Ideal for use in alignment, safety tuning, and instruction-based generation enhancement, this dataset offers a robust foundation for model adaptation and performance improvement. All data complies with global data usage and privacy standards.","dataexampl":null,"datakeyword":["LLM fine-tuning dataset","supervised fine-tuning","SFT dataset","English instruction tuning data","general domain LLM data","AI model fine-tuning","instruction-following training data","GPT tuning dataset"],"isDelete":null,"ids":null,"idsList":null,"datasetCode":null,"productStatus":null,"tagTypeEn":"Type","tagTypeZh":null,"website":null,"samplePresentationList":null,"datazyList":null,"keyInformationList":null,"dataexamplList":null,"bgimg":null,"datazyScriptList":null,"datakeywordListString":null,"sourceShowPage":"llm","dataShowType":"[{\"code\":\"0\",\"language\":\"ZH\"},{\"code\":\"1\",\"language\":\"ZH\"},{\"code\":\"2\",\"language\":\"EN,DE,KO,FR,ES\"},{\"code\":\"3\",\"language\":\"EN\"},{\"code\":\"4\",\"language\":\"JP\"}]","productNameEn":"100,000 Fine-Tuning text data set for English LLM General Domain SFT","BGimg":"","voiceBg":["/shujutang/static/image/comm/audio_bg.webp","/shujutang/static/image/comm/audio_bg2.webp","/shujutang/static/image/comm/audio_bg3.webp","/shujutang/static/image/comm/audio_bg4.webp","/shujutang/static/image/comm/audio_bg5.webp"]}
100K English Instruction Tuning Dataset – General Domain SFT for LLM Fine-Tuning
LLM fine-tuning dataset
supervised fine-tuning
SFT dataset
English instruction tuning data
general domain LLM data
AI model fine-tuning
instruction-following training data
GPT tuning dataset
100,000 Fine-Tuning Text Dataset for English LLM General Domain SFT is a high-quality supervised fine-tuning corpus designed to optimize instruction-following capabilities in large language models. Each data point is double-verified by experienced linguistic professionals and AI engineers to ensure relevance, clarity, and effectiveness in improving model alignment and response precision. The dataset supports instruction tuning tasks across a wide range of general knowledge domains and is compatible with leading open-source LLMs such as LLaMA, Falcon, GPT-NeoX, and Mistral. Ideal for use in alignment, safety tuning, and instruction-based generation enhancement, this dataset offers a robust foundation for model adaptation and performance improvement. All data complies with global data usage and privacy standards.
This is a paid datasets for commercial use, research purpose and more. Licensed ready made datasets help jump-start AI projects.
Specifications
Data content
Contains various types of large model instructions for fine-tuning data
Nexdata’s LLM datasets can support a wide range of large language model development tasks, including pre-training, supervised fine-tuning, instruction tuning, preference optimization, evaluation, and domain-specific model development. Depending on the dataset, data may include text, instruction-response pairs, conversations, question-answer pairs, reasoning data, and other structured or annotated content.
Can Nexdata customize LLM datasets based on our specific model and requirements?
Yes. If our off-the-shelf LLM datasets do not fully match your requirements, Nexdata provides flexible custom data collection, generation, annotation, curation, and quality control services. We can customize datasets based on your target languages, domains, use cases, data formats, task types, volume, and quality requirements to support specific LLM training and evaluation projects.
Can Nexdata provide large-scale and high-quality data for LLM development?
Yes. Nexdata can support large-scale LLM data projects across multiple languages, domains, and data types. Our data services include multi-stage quality control, data cleaning, annotation, validation, and curation to help ensure consistency and usability. For projects requiring data beyond our existing datasets, our customized data services can be scaled according to the required volume, specifications, and delivery schedule.