فهم رابطه، نه فقط توالی
افزودن ساختارهای گرافی به مسیر پردازش، تا ارتباط میان واژهها، اسناد، موضوعها و رابطههای زبانی در بازنمایی مدل حضور داشته باشد.
ما در آزمایشگاه هوش مصنوعی هامان، زیرساختی میسازیم که رابطهٔ میان واژهها، جملهها و اسناد فارسی را به بخشی از هوشمندی مدل تبدیل میکند؛ از متن خام تا گراف، مدل زبانی و محصول قابلتوسعه ای که با فن آوری ما زبان فارسی را بهتر میفهمد.
به زبان ساده، این سکو متن فارسی را میگیرد و ابزارهای لازم برای ساخت گراف، آموزش و اجرای مدل، تحلیل یا تولید متن و اتصال نتیجه به محصول را در یک مسیر فراهم میکند تا زبان فارسی با درک بیشتری در دسترس باشد و خروجی دقیق تری در اختیار فارسی زبانان باشد.
نویسهها را یکدست، متن را پاکسازی و توکنسازی میکند و پیکره را برای پردازش و آموزش آماده میسازد.
رابطهٔ واژهها و اسناد، شباهت متنها، وابستگیهای نحوی و ارتباطهای معنایی را به گرافهای ساده یا چندرابطهای تبدیل میکند.
با مدلهایی مانند GCN، GraphSAGE، GAT و RGCN از ساختار و رابطههای داخل گراف یاد میگیرد.
اطلاعات گراف و توکنهای Transformer را کنار هم میگذارد تا مدل هنگام فهم یا تولید متن، هم توالی و هم رابطه را ببیند.
از آمادهسازی داده و آموزش تا ارزیابی، پیشبینی، استنتاج و تولید متن، یک مسیر یکپارچه و قابلتکرار فراهم میکند.
برای دستهبندی متن و استخراج کلیدواژه، مفهوم، موجودیت و سیگنالهای معنایی قابلاستفاده است.
جملههای مهم را با شواهد گرافی رتبهبندی میکند، خلاصهٔ استخراجی میسازد و اسناد نزدیک را پیشنهاد میدهد.
دانش را در گرهها و رابطهها نگه میدارد، زمینهٔ مرتبط را بازیابی میکند و شواهد رسیدن به نتیجه را قابلمشاهده میسازد.
موتور پایهٔ Graph-LM متن تولید میکند و گردشکار فعلی llm.article برای آمادهسازی، آموزش، ممیزی و تولید مقالهٔ فارسی ساخته شده است.
از طریق Python API، CLI، Web UI و MCP در اختیار برنامهها، محیطهای توسعه و چتباتها قرار میگیرد؛ دسترسی منابع در MCP کنترلشده و فقطخواندنی است.
تمرکز نسخهٔ فعلی RGN بر پردازش، مدلسازی و تولید متن فارسی، ساخت گرافهای زبانی و اتصال این قابلیتها به محصول است.
هدف ما فقط ساخت یک ابزار پردازش متن نیست. میخواهیم زیرساختی در اختیار جامعهٔ فارسیزبان قرار دهیم که مدلها بتوانند ساختار، رابطه و زمینهٔ واژهها و جملههای فارسی را بهتر درک کنند و پژوهشگران و سازندگان ایرانی روی پایهای باز و قابلتوسعه نوآوری کنند.
«از درک بهتر واژهها و جملههای فارسی تا ساخت مدلهای زبانی ایرانی؛ دانشی که در زبان ما ریشه دارد و با جهان تعامل میکند.»
افزودن ساختارهای گرافی به مسیر پردازش، تا ارتباط میان واژهها، اسناد، موضوعها و رابطههای زبانی در بازنمایی مدل حضور داشته باشد.
ساخت توکنساز، گراف، موتور آموزش، ارزیابی و استنتاج برای فارسی؛ بدون تبدیل پروژه به پوستهای روی یک مدل آمادهٔ بیرونی.
کوتاه کردن مسیر پژوهش و محصول برای توسعهدهندگان، پژوهشگران و تیمهایی که آیندهٔ هوش مصنوعی فارسی را میسازند.
Rakhshai Graph-based NLP (RGN) زیرساخت متنباز ما برای تبدیل دادهٔ خام فارسی به گرافهای چندرابطهای، مدلهای گرافی و گردشکارهای زبانی قابلاستقرار است. این سکو آمادهسازی داده، ساخت گراف، آموزش، ارزیابی، استنتاج و اتصال به ابزارهای بیرونی را در یک مسیر منسجم کنار هم قرار میدهد.
لایهٔ پایین و قابلاستفادهٔ مجدد برای توکنسازی، ساخت گراف، رمزگذار گرافی، همجوشی گراف و توکن، آموزش، حافظهٔ گراف و تولید متن.
لایهٔ سطح بالا برای ساخت مدلهای کاربردمحور روی موتور پایه؛ با شروع از llm.article برای آمادهسازی، ممیزی، آموزش و تولید مقالهٔ ساختاریافتهٔ فارسی.
ساخت گراف همرخدادی، واژه–سند، شباهت اسناد، وابستگی نحوی، معنایی و گراف چندرابطهای برای بازنمایی پیوندهایی که در متن خطی پنهان میمانند.
رمزگذارهای گرافی در کنار Transformer علّی و دروازهٔ قابلیادگیری؛ مدل تصمیم میگیرد در هر زمینه چه اندازه از بازنمایی متن و چه اندازه از گراف استفاده کند.
طبقهبندی متن فارسی، تحلیل معنایی، استخراج سیگنالهای مفهومی و مسیرهای آماده برای ارزیابی و پیشبینی.
رتبهبندی جملهها با شواهد گرافی، خلاصهسازی استخراجی و یافتن محتوای نزدیک بر پایهٔ ساختار متن.
رابط پایدار Python، ابزار خط فرمان، رابط وب راستبهچپ و خروجیهای ساختاریافته برای اتصال سریع به محصول.
مخزن را دریافت کنید، محیط مجازی بسازید و نصب پایهٔ یادگیری ماشین را انجام دهید. فرمان پایانی یک نمونهٔ داخلی روی CPU اجرا میکند تا نصب، ساخت گراف واژه–سند و مدل GCN بررسی شوند.
این مسیر مربوط به قابلیتهای عمومی و موتور پروژه است؛ مدل مقالهنویسی هامان در بخش بعد با گردشکار llm.article اجرا میشود.
راهنمای کامل استفاده از API و CLIgit clone https://github.com/bazpardazesh-org/Rakhshai-Graph-based-NLP.git
cd Rakhshai-Graph-based-NLP
python3 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip
python -m pip install -e ".[ml]"
# Built-in CPU smoke example
rgnn-cli --model gcn --device cpu
یک مدل زبانی بومی برای تولید مقالهٔ ساختاریافته که نشان میدهد زیرساخت Rakhshai Graph-based NLP (RGN) چگونه از پژوهش معماری به یک گردشکار واقعی آموزش و تولید میرسد.
ما در شرکت دانشبنیان نرمافزاری آریا هامان مهر پارسه، این مدل را برای تولید مقالهٔ ساختاریافتهٔ فارسی توسعه دادهایم. مدل با دریافت موضوع، مخاطب، لحن و تعداد بخشها، خروجی قابلاستفاده در قالب Markdown یا JSON تولید میکند.
نخستین LLM ایرانی با معماری تولید ایرانی
در این معماری، یک مدل زبانی Transformer از نوع decoder-only را با یک GCN روی گراف واژگانی در سطح پیکره و همجوشی زمینهمحور میان گراف و توکن ترکیب کردهایم. وزنها از مقداردهی اولیهٔ تصادفی آموزش دیدهاند و توکنایزر، گراف و خط لولهٔ آموزش برای زبان فارسی ساخته شدهاند.
وزنهای منتشرشده را از Hugging Face دریافت کنید و با تعیین موضوع، مخاطب، لحن و تعداد بخشها یک مقالهٔ ساختاریافته بسازید.
این مدل با article-generate اجرا میشود؛ فرمان عمومی generate متعلق به موتور سطح پایین rakhshai_graph_nlp.lm است.
مشاهدهٔ کارت مدل و فایلهاpython -m pip install -e .
python -m pip install huggingface_hub
python -c 'from huggingface_hub import snapshot_download; snapshot_download(repo_id="aria-haman/haman-fa-article-graph-llm-125m", local_dir="models/haman-fa-article-graph-llm-125m")'
rgnn-cli article-generate \
--model models/haman-fa-article-graph-llm-125m \
--topic "آینده هوش مصنوعی در آموزش فارسی" \
--audience "دانشجویان" \
--tone "تحلیلی" \
--sections 4 \
--max-new-tokens 700 \
--output-format markdown \
--output-path haman-article.md
در صورت فراهمشدن زیرساخت محاسباتی لازم، بهزودی مدلهای زبانی کاربردیتر و متنوعتری را بر پایهٔ این زیرساخت اضافه خواهیم کرد.
دیتاست Haman Persian Wikipedia Articles 186K مسیر دادهٔ مدل مقالهنویسی را قابلمشاهده و تکرار میکند؛ از دریافت داده تا تبدیل آن به ورودی آمادهٔ گردشکار مقاله.
داده را با کتابخانهٔ datasets دریافت و به JSONL صادر کنید. سپس article-prepare رکوردهای title و text را با قالب wikipedia_prompt به پیکره، دادهٔ آموزش و اعتبارسنجی تبدیل میکند.
خروجی شامل corpus.txt، train.txt، validation.txt، رکوردهای پذیرفته و ردشده و فایل manifest.json است.
python -m pip install -e ".[data]"
mkdir -p data
python - <<'PY'
from datasets import load_dataset
dataset = load_dataset(
"aria-haman/haman-fa-wikipedia-articles-186k",
split="train",
)
print(dataset.column_names)
dataset.to_json(
"data/haman-fa-wikipedia-articles-186k.jsonl",
force_ascii=False,
)
PY
rgnn-cli article-prepare \
--input data/haman-fa-wikipedia-articles-186k.jsonl \
--output-dir runs/haman-dataset-prepared \
--input-format jsonl \
--training-format wikipedia_prompt \
--min-body-chars 400 \
--validation-ratio 0.1
اتصال MCP یک لایهٔ استاندارد و کنترلشده پیرامون هستهٔ Rakhshai Graph-based NLP (RGN) است؛ راهی برای آنکه عاملها (Agent)، محیطهای توسعه، چتباتها و گردشکارهای خودکار از قابلیتهای گرافی فارسی استفاده کنند.
در یک آزمایش زنده با API، شعر و سؤال یکسان به GPT-5.4 داده شد: یکبار مستقیم و یکبار همراه با شواهد گرافی RGN از طریق MCP. پاسخ مجهز به شواهد RGN، در معیار خودکار چهار برابر نشانهٔ مرتبط بیشتری به کار گرفت و امتیاز داوریشدهٔ آن ۱۹٪ بهتر شد.
در آینه، سایهام از من قدیمیتر بود
و نامم از دهانِ پنجره به باران میریخت
چراغی که خوابِ خاکستر میدید
راه را به پای گمشدهام نشان نمیداد
رود از کنار من گذشت
اما تشنگی در مشتهایم لانه کرده بود
گفتم: کدام سو خانه است؟
باد، کلیدی زنگزده را در سکوت چرخاند
شعر فارسی نسبت به نثر روزمره سرشار از نماد، معنای ضمنی و رابطههای دور میان تصویرهاست. این نمونه، آینه، سایه، نام، چراغ، رود، تشنگی، خانه و کلید را به هم پیوند میدهد؛ بنابراین تشخیص چند واژه کافی نیست و مدل باید رابطهٔ میان تصویرها را دنبال و توضیح دهد.
این نتیجه مربوط به یک آزمایش تکنمونهای است و بهتنهایی جای ارزیابی گسترده روی مجموعهای متنوع از شعرها را نمیگیرد.
مشاهدهٔ گزارش کامل و قابلبازتولید آزمایشعاملهای هوش مصنوعی بهجای تولید یک پاسخ منفرد، میتوانند یک هدف را به گامها تقسیم کنند، ابزار مناسب را فراخوانی کنند، شواهد را بخوانند و نتیجه را به سامانهٔ بعدی تحویل دهند. همین توانایی، آنها را به الگویی پرکاربرد برای پژوهش، برنامهنویسی، پشتیبانی، تحلیل اسناد و خودکارسازی گردشکارها تبدیل کرده است.
RGN از طریق MCP، تحلیل فارسی، ساخت گراف، حافظهٔ گراف و توضیحپذیری را بهصورت کنترلشده در اختیار این عاملها قرار میدهد.
ورودی فارسی به شواهد گرافی، حافظهٔ مرتبط و خروجی توضیحپذیر تبدیل میشود، در حالی که منابع پروژه فقط از مسیرهای مجاز و بهصورت کنترلشده در دسترساند.
Rakhshai Graph-based NLP (RGN) یک نقطهٔ پایان نیست؛ پایهای است برای ساخت مدلها و محصولاتی که زبان فارسی را عمیقتر میفهمند و دانش فنی آنها در دسترس جامعهٔ سازندگان باقی میماند.
از نرمالسازی و توکنسازی تا گرافهای چندرابطهای، مدلهای عصبی گرافی، طبقهبندی، خلاصهسازی و تولید متن.
توسعهٔ مدلهای بومی برای کاربردهای گوناگون، با امکان سنجش نقش واقعی گراف و آموزش روی پیکرههای فارسی اختصاصی.
گسترش مجموعهدادهها، معیارهای سنجش و گزارشهای تفکیکشده برای مقایسهٔ مدلها، سنجش کیفیت خروجی و اندازهگیری سهم واقعی گراف.
آزمایشگاه هوش مصنوعی هامان و پروژهٔ Rakhshai Graph-based NLP (RGN) بخشی از مسیر بلندمدت ما برای ساخت فناوری فارسیمحور، زیرساخت هوش مصنوعی و ابزارهای دانشی قابلتوسعهاند. بومیبودن برای ما یعنی شروع از زبان، فرهنگ و دادهٔ ایران و در عین حال تعاملپذیری با استانداردها و ابزارهای جهانی.
محصول «کتابخانهٔ خدمات پردازش زبان طبیعی مبتنی بر گراف» بر پایهٔ پروژهٔ Rakhshai Graph-based NLP (RGN) موفق به دریافت تأییدیهٔ دانشبنیان شده است.
پژوهش، سرمایهگذاری و توسعهٔ این پروژه توسط بخش خصوصی انجام شده است. هدف نهایی ما تنها ساخت یک فناوری نیست؛ میخواهیم هوش مصنوعی را در خدمت صلح، دوستی و گفتوگو قرار دهیم و قدرتهای بیانی، معنایی و دانشی زبان فارسی را در عصر هوش مصنوعی آشکار کنیم.
کد پروژهٔ Rakhshai Graph-based NLP (RGN) با مجوز MIT منتشر شده است. معماری، ابزارهای خط فرمان، رابط پایتون، مستندات و مسیرهای ساخت مدل در مخزن پروژه در دسترساند.