এআই টেকনিকসমূহ ড্ৰাগ আবিষ্কাৰৰ পৰা এলএলএমলৈ হালচাল কমাবলৈ প্ৰয়োগ

৫ ডিচেম্বৰ, ২০২৪

বিপ্লৱী গিটহাব প্ৰকল্পসমূহ: এআইৰ সৈতে স্বয়ংক্রিয় ড্ৰাগ আবিষ্কাৰ

এআই (Artificial Intelligence) ক ড্ৰাগ আবিষ্কাৰত সংযোজন কৰাই ফার্মাসিউটিকেল উদ্যোগকে বিপ্লৱী কৰি তুলিছে। গিটহাবত থকা ওপেন ছোর্স প্ৰকল্পসমূহ ইয়াত গুৰুত্বপূৰ্ণ ভূমিকা পালন কৰে। তলত আমি কিছুমান আটাইতকৈ উদ্ভাৱনী প্রকল্প উপস্থাপন কৰিছোঁ যি এআইৰ সহায়ত স্বয়ংক্রিয় ড্ৰাগ আবিষ্কাৰ আগবঢ়াইছে।

DeepChem: ৰসায়ন ক্ষেত্রত দীপ লার্নিংৰ বাবে ওপেন প্লাটফর্ম

DeepChem হৈছে এগৰাকী শীৰ্ষস্থানীয় ওপেন ছোর্স লাইব্রেৰী যি ৰসায়নিক প্ৰয়োগসমূহৰ বাবে দীপ লার্নিং সহজলভ্য কৰে। ই তলত উল্লেখিত টুলসমূহ উপলব্ধ কৰায়:

  • পদাৰ্থ বিজ্ঞান
  • তাঁৰ ব্যৱহাৰকাৰী-সুবিধাজনক ইন্টারফেইচৰ জৰিয়তে, DeepChem গৱেষকসকলকে গভীৰ AI মডেলসমূহ বাস্তবায়ন কৰিবলৈ সক্ষম কৰে য’ত গভীৰ প্ৰোগ্ৰামিং জ্ঞানৰ আভশ্য নাথাকে। এইটো নতুন ঔষধ আবিষ্কাৰ ত্বরান্বিত কৰে আৰু উদ্যোগত উদ্ভাৱনক আগবঢ়ায়।

    MoleculeNet: ৰসায়নত AI-ৰ বেঞ্চমার্কিং

    MoleculeNet হৈছে এক সমগ্ৰ বেঞ্চমার্কিং ব্যৱস্থা যি বিশেষকৈ ৰাসায়নিক গৱেষণাত মেশিন লাৰ্নিঙৰ বাবে ডিজাইন কৰা। ই অফাৰ কৰে:

    সামঞ্জস্যপূর্ণ বেঞ্চমার্ক প্ৰদান কৰি, MoleculeNet বিভিন্ন AI মডেলৰ তুলনা সহজ কৰে আৰু তেনেকৈ ঔষধ আবিষ্কাৰত অগ্ৰগতি আগবঢ়ায়।

    ATOM Modeling PipeLine (AMPL): Accelerated drug discovery

    The ATOM Modeling PipeLine is a project of the ATOM consortium that aims to accelerate drug development using machine learning. AMPL offers:

    With AMPL, researchers can efficiently build complex models and thus shorten the time from discovery to market launch of new drugs.

    Chemprop: Molecular property prediction with deep learning

    Chemprop uses graphical neural networks to predict molecular properties. Its features include:

    Chemprop বহু প্ৰতিযোগিতাত অদ্বিতীয় ফলাফল লাভ কৰিছে আৰু AI-সহায়ত ৰসায়নৰ বাবে এক মূল্যবান টুল।

    DeepPurpose: ঔষধ আবিষ্কাৰৰ ইউনিভার্সাল টুলকিট

    DeepPurpose হৈছে ঔষধ আবিষ্কাৰৰ বাবে এক সমগ্ৰ ডীপ লার্নিং টুলকিট। ই অফাৰ কৰে:

    ইৰ বহুমুখীতাৰে DeepPurpose গৱেষকসকলকে নতুন থেৰাপিউটিক ক্যান্ডিডেটসমূহ শীঘ্ৰে আৰু দক্ষভাৱে চিনাক্ত কৰিবলৈ সক্ষম কৰে।

    OpenChem: ৰাসায়নিক প্ৰয়োগৰ বাবে বিশেষ ডীপ লার্নিং ফ্রেমওয়ার্ক

    OpenChem হৈছে এক ডীপ লার্নিং ফ্ৰেমৱৰ্ক যি ৰসায়নবিজ্ঞানৰ বাবে বিশেষভাৱে তৈয়াৰ কৰা। ইয়াক নিম্নলিখিত বৈশিষ্ট্যসমূহে চিহ্নিত কৰে:

    OpenChem ৰসায়নিক AI ত নতুন পদ্ধতি বিকাশকে আগবঢ়ায় আৰু গৱেষণা দ্রুততর কৰিবলৈ সহায় কৰে।

    GitHub-এ থকা মুক্ত উৎস সমাজে এই প্ৰকল্পসমূহৰ জৰিয়তে স্বয়ংক্রিয় ঔষধ আবিষ্কাৰৰ সীমা অতিক্ৰম কৰিছে। AI আৰু ৰসায়ন মিলাই থেৰাপিউটিক সমাধান অধিক দক্ষতা ও সঠিকতাৰে বিকাশ কৰাৰ নতুন সম্ভাৱনা উন্মোচন কৰে। এই উদ্ভাৱনসমূহে দীঘলীয়া সময়ৰ বাবে চিকিৎসাৰ ভবিষ্যৎ পৰিবর্তন কৰিব পাৰে।

    ঔষধ গৱেষণা পৰা AI মডেলৰ প্ৰয়োগ: AI মডেলৰ ডিস্টিলেশ্বনলৈ

    The AI ​​models and methods used offer innovative approaches that can be transferred to the distillation of AI models. Although the two fields appear different at first glance, they share common techniques and challenges that make them useful.

    Use of Application

    Applying research models from drug discovery to AI model distillation makes sense because:

  • অপ্টিমাইজেশন আৰু দক্ষতা: ঔষধ আবিষ্কাৰ আৰু মডেল ডিস্টিলেশ্যন দুয়োটা সীমিত সম্পদৰে কার্যক্ষম আৰু শক্তিশালী ফলাফল লাভ কৰিবলৈ লক্ষ্য কৰে। অর্জন।
  • কেনেকৈ ইয়াক প্ৰয়োগ কৰিব পাৰি

    ১. গাঠনিক বুজাবুজিৰ বাবে গ্ৰাফ নিউৰেল নেটৱৰ্ক (GNNs)

    ঔষধ গবেষণাত, গ্ৰাফ নিউৰেল নেটৱৰ্কসমূহ আণবিক গঠন বিশ্লেষণে ব্যৱহৃত হয়। এই পদ্ধতিসমূহ মডেল ডিস্টিলেশ্যনত বৃহৎ মডেলৰ গাঠনিক বুজাবুজি কৰিবলৈ আৰু সৰু মডেলৰ বাবে প্ৰয়োজনীয় বৈশিষ্ট্যসমূহ উলিয়াই ল’বলৈ ব্যৱহাৰ কৰিব পাৰি।

    ২. স্থানান্তৰণ শিক্ষণ আৰু বৈশিষ্ট্য নিষ্কাশন

    DeepChem বা Chempropৰ দৰে প্ৰকল্পসমূহৰ মডেলসমূহ ইতিমধ্যে থকা ডেটা সেটৰ পৰা শিকিবলৈ স্থানান্তৰণ শিক্ষণ ব্যৱহাৰ কৰে। অনুরূপভাবে, ডিস্টিলেশ্যনত এটা বৃহৎ পূৰ্ব-প্ৰশিক্ষিত মডেল আৰম্ভণি বিন্দু হিচাপে কাম কৰিব পাৰে য'ত প্ৰয়োজনীয় বৈশিষ্ট্যসমূহ সৰু মডেললৈ স্থানান্তৰ কৰা হয়।

    ৩। বহুমুখী মডেলৰ বাবে বহু-কাৰ্য শিকনি

    MoleculeNet আদি প্ৰকল্পসমূহে বহু-কাৰ্য শিকনি ব্যৱহাৰ কৰে যাতে একাধিক কাৰ্য একেলগে সামলাব পৰা মডেল গঢ়ি তোলা যায়। এই পদ্ধতি ডিষ্টিলেশ্বনত কমপ্যাক্ট মডেল তৈয়াৰ কৰিবলৈ ব্যৱহৃত হ’ব পাৰে যি এতিয়াও বহুমুখী ফাংকশ্যন সম্পাদন কৰে।

    ৪। ঔষধ আবিষ্কাৰৰ পৰা অপটিমাইজেচন কৌশলসমূহ

    ঔষধ আবিষ্কাৰত ব্যৱহৃত অপটিমাইজেচন পদ্ধতি, যেনে হাইপারপেৰামিটাৰ সূক্ষ্ম-সেটিং বা ইভোলিউশানাৰী এলগৰিদম, ডিষ্টিলড মডেলসমূহ অধিক কার্যক্ষম কৰিবলৈ প্ৰয়োগ কৰিব পাৰি।

    ৫। তথ্য বর্ধন আৰু উত্পাদন

    DeepPurpose আদি প্ৰকল্পসমূহত কৃত্ৰিম তথ্য উত্পন্ন কৰা মূল বিষয়। অনুরূপ কৌশলসমূহ ডিষ্টিলেশ্বনত ছাত্ৰ মডেলৰ শিকনি প্ৰক্ৰিয়া উন্নত কৰিবলৈ ব্যৱহাৰ কৰিব পাৰি, বিশেষকৈ যেতিয়া সীমিত তথ্য উপলব্ধ থাকে।

    ব্যৱহারিক কাৰ্যনির্বাহ ধাপসমূহ

    স্বয়ংক্রিয় ঔষধ আবিষ্কাৰৰ পদ্ধতি AI মডেলৰ ডিস্টিলেশ্যনত সংযোজন কৰাই দক্ষতা বৃদ্ধি আৰু জটিলতা কমাবলৈ নতুন পথ উন্মুক্ত কৰে। প্ৰমাণিত কৌশল স্থানান্তৰ কৰি শক্তিশালী, সঙ্কোচনীয় মডেল বিকাশ কৰিব পাৰি যিয়ে আধুনিক AI আবেদনসমূহৰ চাহিদা পূৰণ কৰে। এই আন্তঃবিষয়ক পদ্ধতি উদ্ভাৱনকে আগুৱাই নেৱে আৰু দুয়োটা গৱেষণা ক্ষেত্ৰত অগ্ৰগতি ত্বরান্বিত কৰে।

    প্ৰসাৰ: ঔষধ আবিষ্কাৰৰ AI কৌশলসমূহ LLM-এ প্ৰয়োগ কৰি হ্যালুসিনেশ্যন কমোৱা

    কৃত্ৰিম বুদ্ধিমত্তাৰ উন্নতি ঔষধ আবিষ্কাৰ আৰু বৃহৎ ভাষা মডেল (LLMs)ৰ বিকাশ উভয়কেই বিপ্লৱ ঘটাইছে। এক আকৰ্ষণীয় প্ৰশ্ন হ'ল, স্বচালিত ঔষধ আবিষ্কাৰৰ কৌশলসমূহ LLMs‑এর পূৰ্বানুমান সঠিকতা বৃদ্ধি আৰু হ্যালুসিনেশন্স কমাতে সহায় কৰিব নেকি। তলত, আমি এই সম্ভাবনাক অন্বেষণ কৰিম আৰু বিশ্লেষণ কৰিম যি এনে প্ৰয়োগ যুক্তিযুক্ত কিনা আৰু এই কৌশলসমূহ ইতিমধ্যে LLMs‑এ ব্যৱহৃত হৈছে নে নাই।

    কেমিষ্ট্ৰিত AI-টেকনিক্স আৰু LLMs‑এর সংযোগ

    1. গ্ৰাফ নিউৰেল নেটৱৰ্ক (GNNs) আৰু গঠন বিশ্লেষণ

    ড্ৰাগ গৱেষণাত, গ্ৰাফ নিউৰেল নেটৱৰ্কস্ ব্যৱহাৰ কৰা হয় আণবিকবোৰৰ জটিল গঠন বুজি পোৱাবলৈ আৰু আগতীয়াকৈ অনুমান কৰিবলৈ। GNNs ডাটা গ্ৰাফ হিচাপে মডেল কৰে, যি ৰাসায়নিক ক্ষেত্ৰত স্বাভাৱিক, কিয়নো আণবিকবোৰে এটম (নোড) আৰু বন্ধন (এজ)ৰ পৰা গঠিত হয়।

    LLMs-লৈ প্ৰয়োগ:

    2. অস্পষ্টতা আৰু অনিশ্চয়তা অনুমান

    ড্ৰাগ আবিষ্কাৰত, অনিশ্চয়তা অনুমান অত্যন্ত প্ৰয়োজনীয় যাতে আগতীয়া ফলাফলৰ বিশ্বাসযোগ্যতা মূল্যায়ন কৰিব পাৰি।

    এলএলএমসমূহৰ বাবে প্ৰয়োগ:

    ৩. মাল্টি-টাস্ক লাৰ্নিং আৰু ট্রান্সফার লাৰ্নিং

    MoleculeNetৰ দৰে প্ৰকল্পসমূহে মাল্টি-টাস্ক লাৰ্নিং ব্যৱহাৰ কৰি একাধিক বৈশিষ্ট্য একেলগে পূৰ্বাভাষ কৰিবলৈ মডেলবোৰকে প্রশিক্ষণ দিয়ে।

    এলএলএমসমূহৰ বাবে প্ৰয়োগ:

  • ডোমেইন জ্ঞানৰ স্থানান্তৰ: ট্রান্সফার লাৰ্নিং মডেলসমূহক ৰসায়নৰ বিশেষজ্ঞতা ব্যৱহাৰ কৰিবলৈ অনুমতি দিয়ে যাতে সেই ক্ষেত্ৰত অধিক সঠিক বিবৃতি দিয়া যায়।
  • 4. ডাটা অগমেন্টেশ্বন আৰু সিন্থেটিক ডাটা জেনারেশন

    ৰসায়নত, সিন্থেটিক ডাটা মডেল উন্নত কৰিবলৈ ব্যৱহৃত হয়, বিশেষকৈ যেতিয়া বাস্তৱ-জগতৰ ডাটা সীমিত থাকে।

    LLM সমূহলৈ প্ৰয়োগ:

    অ্যাপ্লিকেশ্বনটো যুক্তিযুক্ত নেকি?

    এআই-সহায়ত ঔষধ আবিষ্কাৰৰ পৰা এলএলএমলৈ প্ৰযুক্তি স্থানান্তৰ কৰা সৈদ্ধান্তিকভাৱে যুক্তিযুক্ত, যেহেতু দুয়ো ক্ষেত্ৰেই জটিল তথ্য কাঠামো আৰু মেশিন লার্নিং ব্যৱহাৰ কৰে। কিছুমান কাৰণ হ'ল:

    চেলেঞ্জসমূহ

    এই প্ৰযুক্তিসমূহ ইতিমধ্যে এলএলএমত ব্যৱহৃত হৈছে নেকি?

    Muchas de las técnicas mencionadas ya se utilizan en los LLMs de alguna forma integrada:

    Enfoques innovadores potenciales

    A pesar de las técnicas existentes, existe potencial para nuevos enfoques:

    Aplicar técnicas del descubrimiento automático de fármacos a los LLMs ofrece oportunidades emocionantes para mejorar la precisión de las predicciones y reducir las alucinaciones. Aunque algunos métodos ya se utilizan en los LLMs, hay espacio para más innovación mediante un enfoque interdisciplinario. Los desafíos radican principalmente en los diferentes tipos de datos y la escalabilidad. No obstante, la colaboración entre estos dos campos podría conducir a avances significativos en la investigación de IA.

    Experimento mental breve: ¿Tiene sentido?

    কেমিষ্ট্রি আৰু প্ৰাকৃতিক ভাষা প্ৰথম দৃষ্টিত ভিন্ন, কিন্তু দুয়োটা জটিল নিয়ম আৰু গঠন থকা ব্যৱস্থা। কেমিষ্ট্ৰীত মডেলিং আৰু পূৰ্বাভাষৰ টেকনিকসমূহে প্ৰাকৃতিক ভাষা প্ৰক্ৰিয়াকৰণত মূল্যবান ইনপুট আগবঢ়াব পাৰে। আন্তঃশাস্ত্রীয় পদ্ধতি গ্ৰহণ কৰিবলৈ খোলা মনোভাব থকা গুৰুত্বপূর্ণ, কাৰণ উদ্ভাৱন সাধাৰণতে বিভিন্ন শাখাৰ সংযোগস্থলত উত্পন্ন হয়।

    ড্ৰাগ আবিষ্কাৰৰ পৰা AI টেকনিকসমূহ LLM বিকাশত একীভূত কৰা এই মডেলবোৰৰ কার্যক্ষমতা অধিক বৃদ্ধি কৰাৰ সম্ভাব্য উপায় হ’ব পাৰে। একে আনক শিকি, দুয়োটা ক্ষেত্রেই একে আনৰ পৰা লাভবান হ'ব আৰু মিলিতভাবে AI গৱেষণাত নতুন দিশ উন্মুক্ত কৰিব।

    Hugging Face ব্যৱহাৰ কৰি LLM‑সমূহত হ্যালুসিনেশ্বন কমাবলৈ কাৰ্যকৰী পদ্ধতি

    A continuación, mostramos cómo crear un modelo de lenguaje con estimación de incertidumbre utilizando Hugging Face y Python para reducir las alucinaciones. Utilizamos técnicas inspiradas en métodos empleados en el descubrimiento automatizado de fármacos, en particular la estimación de incertidumbre mediante Monte Carlo dropout.

    Requisitos

    Puedes instalar las librerías requeridas usando el siguiente comando:

    pip install transformers torch datasets
    

    Implementación del código

    import torch
    from transformers import AutoTokenizer, AutoModelForCausalLM
    import torch.nn.functional as F
    import numpy as np
    
    # Մոդելի և tokenizer‑ի բեռնում
    model_name = 'gpt2'
    tokenizer = AutoTokenizer.from_pretrained(model_name)
    model = AutoModelForCausalLM.from_pretrained(model_name)
    
    # Dropout‑ը ակտիվացնել գնահատման ռեժիմում նույնպես
    def enable_dropout(model):
        """Միացնում է dropout‑ի շերտերը մոդելում գնահատման ժամանակ։"""
        for module in model.modules():
            if isinstance(module, torch.nn.Dropout):
                module.train()
    
    # Ֆունկցիա անորոշության գնահատմամբ գեներացիայի համար
    def generate_with_uncertainty(model, tokenizer, prompt, num_samples=5, max_length=50):
        model.eval()
        enable_dropout(model)
        inputs = tokenizer(prompt, return_tensors='pt')
        input_ids = inputs['input_ids']
    
        # Բազմակի կանխատեսումներ անորոշության գնահատման համար
        outputs = []
        for _ in range(num_samples):
            with torch.no_grad():
                output = model.generate(
                    input_ids=input_ids,
                    max_length=max_length,
                    do_sample=True,
                    top_k=50,
                    top_p=0.95
                )
                outputs.append(output)
    
        # Գեներացված հաջորդականությունների դեկոդավորում
        sequences = [tokenizer.decode(output[0], skip_special_tokens=True) for output in outputs]
    
        # Անորոշության (энтропիայի) հաշվարկը
        probs = [] 
        for output in outputs:
            with torch.no_grad():
                logits = model(output)['logits']
                prob = F.softmax(logits, dim=-1)
                probs.append(prob.cpu().numpy())
    
        # Միջին էնտրոպիան հաշվել
        entropies = []
        for prob in probs:
            entropy = -np.sum(prob * np.log(prob + 1e-8)) / prob.size
            entropies.append(entropy)
    
        avg_entropy = np.mean(entropies)
        uncertainty = avg_entropy
    
        # Ամենահաճախ հանդիպող հաջորդականության ընտրություն
        from collections import Counter
        sequence_counts = Counter(sequences)
        most_common_sequence = sequence_counts.most_common(1)[0][0]
    
        return {
            'generated_text': most_common_sequence,
            'uncertainty': uncertainty
        }
    
    # Օրինակ օգտագործման համար
    prompt = "The impact of artificial intelligence on medicine is"
    
    result = generate_with_uncertainty(model, tokenizer, prompt)
    print("Generated text:")
    print(result['generated_text'])
    print("Estimated uncertainty:", result['uncertainty'])
    

    Կոդի բացատրություն

    GitHub ৰেপ'জিটৰী ব্যৱহাৰ

    বিস্তৃত কার্যক্ষমতা আৰু উন্নত পদ্ধতিৰ বাবে তলত উল্লেখিত GitHub ৰেপ'জিটৰীসমূহ উপযোগী হ’ব পাৰে:

    বিস্তাৰ বিকল্পসমূহ

    উপসংহার

    অনিশ্চয়তা অনুমান আৰু স্বয়ংক্ৰিয় ঔষধ আবিষ্কাৰৰ কৌশল প্ৰয়োগ কৰি, আমি ভাষা মডেলৰ বিশ্বাসযোগ্যতা বৃদ্ধি কৰিব পাৰি আৰু অনাকাঙ্ক্ষিত হ্যালুসিনেশ্যন কমাই দিব। দিয়া বাস্তবায়নটো এক সূচনা বিন্দু হিচাপে কাম কৰে আৰু বিশেষ চাহিদা পূৰণ কৰিবলৈ অধিক বিকাশ কৰা যেতিবিলিকে সম্ভৱ।

    টীকা: ওপৰত দেখুওৱা বাস্তবায়নটি এটা সহজ উদাহরণ। উৎপাদন পৰিৱেশত, দক্ষতা, স্কেলেবিলিটি আৰু নৈতিক বিবেচনা আদি অন্যান্য দিশসমূহকো মনত ৰাখিব লাগিব।

    লেখক: Thomas Jan Poschadel

    COPYRIGHT ToNEKi Media UG (haftungsbeschränkt)

    “Transfer