Persian-first · Graph-native · Open-source

زبان فارسی، درون یک گراف زنده از معنا

ما در آزمایشگاه هوش مصنوعی هامان، زیرساختی می‌سازیم که رابطهٔ میان واژه‌ها، جمله‌ها و اسناد فارسی را به بخشی از هوشمندی مدل تبدیل می‌کند؛ از متن خام تا گراف، مدل زبانی و محصول قابل‌توسعه ای که با فن آوری ما زبان فارسی را بهتر میفهمد.

یک پروژهٔ متن‌باز از شرکت دانش‌بنیان نرم‌افزاری آریا هامان مهر پارسه
گراف مفهومی زبان فارسی گره‌های واژه، جمله، سند، معنا و مدل که با رابطه‌های گرافی به هم متصل‌اند. واژهTOKEN جملهCONTEXT گرافRELATION حافظهMEMORY مدلGRAPH-LM سندDOCUMENT فارسیPERSIAN AI
Rakhshai Graph-based NLP (RGN) رابطه، زمینه و حافظه برای فهم عمیق‌تر متن فارسی
RGN · CAPABILITY MAP

Rakhshai Graph-based NLP (RGN) چه کارهایی انجام می‌دهد؟

به زبان ساده، این سکو متن فارسی را می‌گیرد و ابزارهای لازم برای ساخت گراف، آموزش و اجرای مدل، تحلیل یا تولید متن و اتصال نتیجه به محصول را در یک مسیر فراهم می‌کند تا زبان فارسی با درک بیشتری در دسترس باشد و خروجی دقیق تری در اختیار فارسی زبانان باشد.

  1. متن فارسی را آماده می‌کند

    نویسه‌ها را یکدست، متن را پاک‌سازی و توکن‌سازی می‌کند و پیکره را برای پردازش و آموزش آماده می‌سازد.

  2. از متن، چند نوع گراف می‌سازد

    رابطهٔ واژه‌ها و اسناد، شباهت متن‌ها، وابستگی‌های نحوی و ارتباط‌های معنایی را به گراف‌های ساده یا چندرابطه‌ای تبدیل می‌کند.

  3. شبکه‌های عصبی گرافی را آموزش می‌دهد

    با مدل‌هایی مانند GCN، GraphSAGE، GAT و RGCN از ساختار و رابطه‌های داخل گراف یاد می‌گیرد.

  4. گراف را با مدل زبانی ترکیب می‌کند

    اطلاعات گراف و توکن‌های Transformer را کنار هم می‌گذارد تا مدل هنگام فهم یا تولید متن، هم توالی و هم رابطه را ببیند.

  5. چرخهٔ کامل ساخت مدل را پوشش می‌دهد

    از آماده‌سازی داده و آموزش تا ارزیابی، پیش‌بینی، استنتاج و تولید متن، یک مسیر یکپارچه و قابل‌تکرار فراهم می‌کند.

  6. متن را تحلیل و طبقه‌بندی می‌کند

    برای دسته‌بندی متن و استخراج کلیدواژه، مفهوم، موجودیت و سیگنال‌های معنایی قابل‌استفاده است.

  7. خلاصه و محتوای مرتبط پیدا می‌کند

    جمله‌های مهم را با شواهد گرافی رتبه‌بندی می‌کند، خلاصهٔ استخراجی می‌سازد و اسناد نزدیک را پیشنهاد می‌دهد.

  8. گراف دانش، حافظه و توضیح می‌سازد

    دانش را در گره‌ها و رابطه‌ها نگه می‌دارد، زمینهٔ مرتبط را بازیابی می‌کند و شواهد رسیدن به نتیجه را قابل‌مشاهده می‌سازد.

  9. متن و مقالهٔ ساختاریافته تولید می‌کند

    موتور پایهٔ Graph-LM متن تولید می‌کند و گردش‌کار فعلی llm.article برای آماده‌سازی، آموزش، ممیزی و تولید مقالهٔ فارسی ساخته شده است.

  10. به محصول، عامل و ابزار وصل می‌شود

    از طریق Python API، CLI، Web UI و MCP در اختیار برنامه‌ها، محیط‌های توسعه و چت‌بات‌ها قرار می‌گیرد؛ دسترسی منابع در MCP کنترل‌شده و فقط‌خواندنی است.

تمرکز نسخهٔ فعلی RGN بر پردازش، مدل‌سازی و تولید متن فارسی، ساخت گراف‌های زبانی و اتصال این قابلیت‌ها به محصول است.

فارسی‌محوراز توکن‌ساز تا مدل
گراف‌محورروابط چندگانهٔ زبانی
متن‌بازMIT License
قابل‌اتصالPython · CLI · MCP
ماموریت ما

قدرت بخشیدن به زبان فارسی در عصر مدل‌های بزرگ

هدف ما فقط ساخت یک ابزار پردازش متن نیست. می‌خواهیم زیرساختی در اختیار جامعهٔ فارسی‌زبان قرار دهیم که مدل‌ها بتوانند ساختار، رابطه و زمینهٔ واژه‌ها و جمله‌های فارسی را بهتر درک کنند و پژوهشگران و سازندگان ایرانی روی پایه‌ای باز و قابل‌توسعه نوآوری کنند.

«از درک بهتر واژه‌ها و جمله‌های فارسی تا ساخت مدل‌های زبانی ایرانی؛ دانشی که در زبان ما ریشه دارد و با جهان تعامل می‌کند.»

01 / LANGUAGE

فهم رابطه، نه فقط توالی

افزودن ساختارهای گرافی به مسیر پردازش، تا ارتباط میان واژه‌ها، اسناد، موضوع‌ها و رابطه‌های زبانی در بازنمایی مدل حضور داشته باشد.

02 / INFRASTRUCTURE

زیرساخت بومی و قابل تکرار

ساخت توکن‌ساز، گراف، موتور آموزش، ارزیابی و استنتاج برای فارسی؛ بدون تبدیل پروژه به پوسته‌ای روی یک مدل آمادهٔ بیرونی.

03 / COMMUNITY

توان بیشتر برای جامعهٔ تخصصی

کوتاه کردن مسیر پژوهش و محصول برای توسعه‌دهندگان، پژوهشگران و تیم‌هایی که آیندهٔ هوش مصنوعی فارسی را می‌سازند.

Rakhshai Graph-based NLP (RGN)

نخستین سکوی یکپارچهٔ NLP گراف‌محور برای زبان فارسی

Rakhshai Graph-based NLP (RGN) زیرساخت متن‌باز ما برای تبدیل دادهٔ خام فارسی به گراف‌های چندرابطه‌ای، مدل‌های گرافی و گردش‌کارهای زبانی قابل‌استقرار است. این سکو آماده‌سازی داده، ساخت گراف، آموزش، ارزیابی، استنتاج و اتصال به ابزارهای بیرونی را در یک مسیر منسجم کنار هم قرار می‌دهد.

متن فارسیداده و پیکرهٔ خام
پردازش فارسینرمال‌سازی و توکن‌سازی
گراف چندرابطه‌ایواژه، سند، نحو و معنا
استدلال گرافیGCN · GAT · RGCN
مدل و محصولتحلیل، تولید و اتصال
rakhshai_graph_nlp.lm

موتور پایهٔ Graph-LM

لایهٔ پایین و قابل‌استفادهٔ مجدد برای توکن‌سازی، ساخت گراف، رمزگذار گرافی، همجوشی گراف و توکن، آموزش، حافظهٔ گراف و تولید متن.

rakhshai_graph_nlp.llm

گردش‌کارهای محصولی مدل زبانی

لایهٔ سطح بالا برای ساخت مدل‌های کاربردمحور روی موتور پایه؛ با شروع از llm.article برای آماده‌سازی، ممیزی، آموزش و تولید مقالهٔ ساختاریافتهٔ فارسی.

گراف‌های غنی برای متن فارسی

ساخت گراف هم‌رخدادی، واژه–سند، شباهت اسناد، وابستگی نحوی، معنایی و گراف چندرابطه‌ای برای بازنمایی پیوندهایی که در متن خطی پنهان می‌مانند.

co-occurrenceword-documentdependencysemanticmulti-relation

مدل‌های عصبی و همجوشی تطبیقی

رمزگذارهای گرافی در کنار Transformer علّی و دروازهٔ قابل‌یادگیری؛ مدل تصمیم می‌گیرد در هر زمینه چه اندازه از بازنمایی متن و چه اندازه از گراف استفاده کند.

GCNGraphSAGEGATRGCNcontext-gated fusion

تحلیل و طبقه‌بندی

طبقه‌بندی متن فارسی، تحلیل معنایی، استخراج سیگنال‌های مفهومی و مسیرهای آماده برای ارزیابی و پیش‌بینی.

خلاصه‌سازی و توصیه

رتبه‌بندی جمله‌ها با شواهد گرافی، خلاصه‌سازی استخراجی و یافتن محتوای نزدیک بر پایهٔ ساختار متن.

رابط‌های توسعه

رابط پایدار Python، ابزار خط فرمان، رابط وب راست‌به‌چپ و خروجی‌های ساختاریافته برای اتصال سریع به محصول.

PROJECT QUICK START

نصب و اجرای نخستین نمونهٔ پروژه

مخزن را دریافت کنید، محیط مجازی بسازید و نصب پایهٔ یادگیری ماشین را انجام دهید. فرمان پایانی یک نمونهٔ داخلی روی CPU اجرا می‌کند تا نصب، ساخت گراف واژه–سند و مدل GCN بررسی شوند.

این مسیر مربوط به قابلیت‌های عمومی و موتور پروژه است؛ مدل مقاله‌نویسی هامان در بخش بعد با گردش‌کار llm.article اجرا می‌شود.

راهنمای کامل استفاده از API و CLI
install-and-check.sh
git clone https://github.com/bazpardazesh-org/Rakhshai-Graph-based-NLP.git
cd Rakhshai-Graph-based-NLP

python3 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip
python -m pip install -e ".[ml]"

# Built-in CPU smoke example
rgnn-cli --model gcn --device cpu
نخستین خروجی شاخص زیرساخت

مدل مقاله‌نویسی فارسی هامان

یک مدل زبانی بومی برای تولید مقالهٔ ساختاریافته که نشان می‌دهد زیرساخت Rakhshai Graph-based NLP (RGN) چگونه از پژوهش معماری به یک گردش‌کار واقعی آموزش و تولید می‌رسد.

125M PARAMETERS · PERSIAN ARTICLE LLM

Haman Persian Article Graph-LLM 125M

ما در شرکت دانش‌بنیان نرم‌افزاری آریا هامان مهر پارسه، این مدل را برای تولید مقالهٔ ساختاریافتهٔ فارسی توسعه داده‌ایم. مدل با دریافت موضوع، مخاطب، لحن و تعداد بخش‌ها، خروجی قابل‌استفاده در قالب Markdown یا JSON تولید می‌کند.

نخستین LLM ایرانی با معماری تولید ایرانی

در این معماری، یک مدل زبانی Transformer از نوع decoder-only را با یک GCN روی گراف واژگانی در سطح پیکره و همجوشی زمینه‌محور میان گراف و توکن ترکیب کرده‌ایم. وزن‌ها از مقداردهی اولیهٔ تصادفی آموزش دیده‌اند و توکنایزر، گراف و خط لولهٔ آموزش برای زبان فارسی ساخته شده‌اند.

معماری زبانیDecoder-only Transformer
رمزگذار گرافCorpus-level lexical GCN
همجوشیContext-gated graph-token fusion
مسیر آموزشبومی، از مقداردهی تصادفی
کنترل تولیدموضوع، مخاطب، لحن و بخش‌ها
خروجیStructured Markdown / JSON
این نسخه برای پیروی از دستور تنظیم نشده است و نباید به‌عنوان مرجع واقعیت یا سامانهٔ پاسخ‌گویی قطعی استفاده شود.
MODEL QUICK START

دریافت و اجرای مدل هامان

وزن‌های منتشرشده را از Hugging Face دریافت کنید و با تعیین موضوع، مخاطب، لحن و تعداد بخش‌ها یک مقالهٔ ساختاریافته بسازید.

این مدل با article-generate اجرا می‌شود؛ فرمان عمومی generate متعلق به موتور سطح پایین rakhshai_graph_nlp.lm است.

مشاهدهٔ کارت مدل و فایل‌ها
run-haman-model.sh
python -m pip install -e .
python -m pip install huggingface_hub

python -c 'from huggingface_hub import snapshot_download; snapshot_download(repo_id="aria-haman/haman-fa-article-graph-llm-125m", local_dir="models/haman-fa-article-graph-llm-125m")'

rgnn-cli article-generate \
  --model models/haman-fa-article-graph-llm-125m \
  --topic "آینده هوش مصنوعی در آموزش فارسی" \
  --audience "دانشجویان" \
  --tone "تحلیلی" \
  --sections 4 \
  --max-new-tokens 700 \
  --output-format markdown \
  --output-path haman-article.md
NEXT
مدل‌های کاربردی‌تر در راه‌اند

در صورت فراهم‌شدن زیرساخت محاسباتی لازم، به‌زودی مدل‌های زبانی کاربردی‌تر و متنوع‌تری را بر پایهٔ این زیرساخت اضافه خواهیم کرد.

OPEN DATA · REPRODUCIBLE PIPELINE

دیتاست مقاله‌های فارسی هامان

دیتاست Haman Persian Wikipedia Articles 186K مسیر دادهٔ مدل مقاله‌نویسی را قابل‌مشاهده و تکرار می‌کند؛ از دریافت داده تا تبدیل آن به ورودی آمادهٔ گردش‌کار مقاله.

DATASET QUICK START

از Hugging Face تا ورودی آموزش RGN

داده را با کتابخانهٔ datasets دریافت و به JSONL صادر کنید. سپس article-prepare رکوردهای title و text را با قالب wikipedia_prompt به پیکره، دادهٔ آموزش و اعتبارسنجی تبدیل می‌کند.

titletextJSONLwikipedia_prompt

خروجی شامل corpus.txt، train.txt، validation.txt، رکوردهای پذیرفته و ردشده و فایل manifest.json است.

prepare-haman-dataset.sh
python -m pip install -e ".[data]"
mkdir -p data

python - <<'PY'
from datasets import load_dataset

dataset = load_dataset(
    "aria-haman/haman-fa-wikipedia-articles-186k",
    split="train",
)
print(dataset.column_names)
dataset.to_json(
    "data/haman-fa-wikipedia-articles-186k.jsonl",
    force_ascii=False,
)
PY

rgnn-cli article-prepare \
  --input data/haman-fa-wikipedia-articles-186k.jsonl \
  --output-dir runs/haman-dataset-prepared \
  --input-format jsonl \
  --training-format wikipedia_prompt \
  --min-body-chars 400 \
  --validation-ratio 0.1
MODEL CONTEXT PROTOCOL

Rakhshai Graph-based NLP (RGN) در دسترس عامل‌ها (Agent) و ابزارها

اتصال MCP یک لایهٔ استاندارد و کنترل‌شده پیرامون هستهٔ Rakhshai Graph-based NLP (RGN) است؛ راهی برای آن‌که عامل‌ها (Agent)، محیط‌های توسعه، چت‌بات‌ها و گردش‌کارهای خودکار از قابلیت‌های گرافی فارسی استفاده کنند.

LIVE API EVALUATION · SINGLE SAMPLE

آزمایش زندهٔ درک و تحلیل یک شعر فارسی

در یک آزمایش زنده با API، شعر و سؤال یکسان به GPT-5.4 داده شد: یک‌بار مستقیم و یک‌بار همراه با شواهد گرافی RGN از طریق MCP. پاسخ مجهز به شواهد RGN، در معیار خودکار چهار برابر نشانهٔ مرتبط بیشتری به کار گرفت و امتیاز داوری‌شدهٔ آن ۱۹٪ بهتر شد.

۴×شواهد مرتبط برای درک شعر
۱۹٪بهبود امتیاز کلی
۲۱ → ۲۵امتیاز داوری‌شده

در آینه، سایه‌ام از من قدیمی‌تر بود
و نامم از دهانِ پنجره به باران می‌ریخت

چراغی که خوابِ خاکستر می‌دید
راه را به پای گم‌شده‌ام نشان نمی‌داد

رود از کنار من گذشت
اما تشنگی در مشت‌هایم لانه کرده بود

گفتم: کدام سو خانه است؟
باد، کلیدی زنگ‌زده را در سکوت چرخاند

چرا شعر را برای آزمایش انتخاب کردیم؟

شعر فارسی نسبت به نثر روزمره سرشار از نماد، معنای ضمنی و رابطه‌های دور میان تصویرهاست. این نمونه، آینه، سایه، نام، چراغ، رود، تشنگی، خانه و کلید را به هم پیوند می‌دهد؛ بنابراین تشخیص چند واژه کافی نیست و مدل باید رابطهٔ میان تصویرها را دنبال و توضیح دهد.

این نتیجه مربوط به یک آزمایش تک‌نمونه‌ای است و به‌تنهایی جای ارزیابی گسترده روی مجموعه‌ای متنوع از شعرها را نمی‌گیرد.

مشاهدهٔ گزارش کامل و قابل‌بازتولید آزمایش
AGENT ECOSYSTEM

عامل‌ها (Agent) چرا محبوب شده‌اند؟

عامل‌های هوش مصنوعی به‌جای تولید یک پاسخ منفرد، می‌توانند یک هدف را به گام‌ها تقسیم کنند، ابزار مناسب را فراخوانی کنند، شواهد را بخوانند و نتیجه را به سامانهٔ بعدی تحویل دهند. همین توانایی، آن‌ها را به الگویی پرکاربرد برای پژوهش، برنامه‌نویسی، پشتیبانی، تحلیل اسناد و خودکارسازی گردش‌کارها تبدیل کرده است.

RGN از طریق MCP، تحلیل فارسی، ساخت گراف، حافظهٔ گراف و توضیح‌پذیری را به‌صورت کنترل‌شده در اختیار این عامل‌ها قرار می‌دهد.

پژوهش و گردآوری شواهددستیار برنامه‌نویسیتحلیل و خلاصه‌سازی اسنادچت‌بات و پشتیبانیگردش‌کار خودکار

یک رابط، چند توانمندی

ورودی فارسی به شواهد گرافی، حافظهٔ مرتبط و خروجی توضیح‌پذیر تبدیل می‌شود، در حالی که منابع پروژه فقط از مسیرهای مجاز و به‌صورت کنترل‌شده در دسترس‌اند.

  • تحلیل متن فارسی و استخراج کلیدواژه، مفهوم و سیگنال
  • ساخت گراف دانش و خلاصه‌سازی بر پایهٔ گره‌ها و روابط مهم
  • بازیابی از حافظهٔ گراف و تولید با شواهد مرتبط با درخواست
  • توضیح‌پذیری از طریق گره‌ها، رابطه‌ها و مسیرهای استدلال
  • منابع فقط‌خواندنی و محدود به فهرست مسیرهای مجاز
rakhshai-mcp / graph_reasoning
01Persian question
rakhshai_analyze_persian_text
rakhshai_build_knowledge_graph
graph memory + relevant evidence
02grounded, explainable context
03agent / IDE / chatbot / workflow
افق توسعه

از زیرساخت متن تا نسل تازهٔ هوش مصنوعی فارسی

Rakhshai Graph-based NLP (RGN) یک نقطهٔ پایان نیست؛ پایه‌ای است برای ساخت مدل‌ها و محصولاتی که زبان فارسی را عمیق‌تر می‌فهمند و دانش فنی آن‌ها در دسترس جامعهٔ سازندگان باقی می‌ماند.

اکنون

پردازش و مدل‌سازی متن فارسی

از نرمال‌سازی و توکن‌سازی تا گراف‌های چندرابطه‌ای، مدل‌های عصبی گرافی، طبقه‌بندی، خلاصه‌سازی و تولید متن.

مسیر جاری

مدل‌های زبانی ایرانی

توسعهٔ مدل‌های بومی برای کاربردهای گوناگون، با امکان سنجش نقش واقعی گراف و آموزش روی پیکره‌های فارسی اختصاصی.

آینده

ارزیابی‌های جامع و قابل‌تکرار فارسی

گسترش مجموعه‌داده‌ها، معیارهای سنجش و گزارش‌های تفکیک‌شده برای مقایسهٔ مدل‌ها، سنجش کیفیت خروجی و اندازه‌گیری سهم واقعی گراف.

نشان شرکت آریا هامان مهر پارسه
پشتوانهٔ پروژه

شرکت دانش‌بنیان نرم‌افزاری آریا هامان مهر پارسه

آزمایشگاه هوش مصنوعی هامان و پروژهٔ Rakhshai Graph-based NLP (RGN) بخشی از مسیر بلندمدت ما برای ساخت فناوری فارسی‌محور، زیرساخت هوش مصنوعی و ابزارهای دانشی قابل‌توسعه‌اند. بومی‌بودن برای ما یعنی شروع از زبان، فرهنگ و دادهٔ ایران و در عین حال تعامل‌پذیری با استانداردها و ابزارهای جهانی.

محصول «کتابخانهٔ خدمات پردازش زبان طبیعی مبتنی بر گراف» بر پایهٔ پروژهٔ Rakhshai Graph-based NLP (RGN) موفق به دریافت تأییدیهٔ دانش‌بنیان شده است.

دربارهٔ ما · یک ابتکار بخش خصوصی

ساخته‌شده در بخش خصوصی، برای هدفی انسانی

پژوهش، سرمایه‌گذاری و توسعهٔ این پروژه توسط بخش خصوصی انجام شده است. هدف نهایی ما تنها ساخت یک فناوری نیست؛ می‌خواهیم هوش مصنوعی را در خدمت صلح، دوستی و گفت‌وگو قرار دهیم و قدرت‌های بیانی، معنایی و دانشی زبان فارسی را در عصر هوش مصنوعی آشکار کنیم.

صلحدوستیزبان فارسیدانش باز
متن‌باز، برای ساختن

زیرساخت فارسی را ببینید، اجرا کنید و توسعه دهید

کد پروژهٔ Rakhshai Graph-based NLP (RGN) با مجوز MIT منتشر شده است. معماری، ابزارهای خط فرمان، رابط پایتون، مستندات و مسیرهای ساخت مدل در مخزن پروژه در دسترس‌اند.