সি # তে & nbsp সহ স্ট্রিং থেকে এইচটিএমএল ট্যাগগুলি সরান

Question 1

আমি কীভাবে সি # তে রেজেক্স ব্যবহার করে & nbsp সহ সমস্ত এইচটিএমএল ট্যাগগুলি সরিয়ে ফেলতে পারি। আমার স্ট্রিং দেখে মনে হচ্ছে

  "<div>hello</div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div><div>&nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp; &nbsp;&nbsp;</div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div><div><br></div>"

Question 2

আপনি যদি ট্যাগগুলি ফিল্টার করার জন্য এইচটিএমএল পার্সার ওরিয়েন্টেড সমাধানটি ব্যবহার করতে না পারেন, তবে এটির জন্য এখানে একটি সরল রেইগেক্স।

string noHTML = Regex.Replace(inputHTML, @"<[^>]+>|&nbsp;", "").Trim();

আপনার আদর্শভাবে একটি রেজেক্স ফিল্টার দিয়ে অন্য পাস করা উচিত যা একাধিক স্পেস হিসাবে যত্ন নেয়

string noHTMLNormalised = Regex.Replace(noHTML, @"\s{2,}", " ");

Question 3

আমি @ রবি থাপলিয়ালের কোড নিয়েছি এবং একটি পদ্ধতি তৈরি করেছি: এটি সহজ এবং সম্ভবত সবকিছু পরিষ্কার করা যায় না, তবে এখনও পর্যন্ত এটি আমার যা করা দরকার তা করছে is

public static string ScrubHtml(string value) {
    var step1 = Regex.Replace(value, @"<[^>]+>|&nbsp;", "").Trim();
    var step2 = Regex.Replace(step1, @"\s{2,}", " ");
    return step2;
}

Question 4

আমি এই ফাংশনটি কিছুক্ষণ ব্যবহার করছি using আপনি এটি ফেলে দিতে পারেন এমন কোনও অগোছালো এইচটিএমএল সরিয়ে দেয় এবং পাঠ্য অক্ষত রেখে দেয়।

        private static readonly Regex _tags_ = new Regex(@"<[^>]+?>", RegexOptions.Multiline | RegexOptions.Compiled);

        //add characters that are should not be removed to this regex
        private static readonly Regex _notOkCharacter_ = new Regex(@"[^\w;&#@.:/\\?=|%!() -]", RegexOptions.Compiled);

        public static String UnHtml(String html)
        {
            html = HttpUtility.UrlDecode(html);
            html = HttpUtility.HtmlDecode(html);

            html = RemoveTag(html, "<!--", "-->");
            html = RemoveTag(html, "<script", "</script>");
            html = RemoveTag(html, "<style", "</style>");

            //replace matches of these regexes with space
            html = _tags_.Replace(html, " ");
            html = _notOkCharacter_.Replace(html, " ");
            html = SingleSpacedTrim(html);

            return html;
        }

        private static String RemoveTag(String html, String startTag, String endTag)
        {
            Boolean bAgain;
            do
            {
                bAgain = false;
                Int32 startTagPos = html.IndexOf(startTag, 0, StringComparison.CurrentCultureIgnoreCase);
                if (startTagPos < 0)
                    continue;
                Int32 endTagPos = html.IndexOf(endTag, startTagPos + 1, StringComparison.CurrentCultureIgnoreCase);
                if (endTagPos <= startTagPos)
                    continue;
                html = html.Remove(startTagPos, endTagPos - startTagPos + endTag.Length);
                bAgain = true;
            } while (bAgain);
            return html;
        }

        private static String SingleSpacedTrim(String inString)
        {
            StringBuilder sb = new StringBuilder();
            Boolean inBlanks = false;
            foreach (Char c in inString)
            {
                switch (c)
                {
                    case '\r':
                    case '\n':
                    case '\t':
                    case ' ':
                        if (!inBlanks)
                        {
                            inBlanks = true;
                            sb.Append(' ');
                        }   
                        continue;
                    default:
                        inBlanks = false;
                        sb.Append(c);
                        break;
                }
            }
            return sb.ToString().Trim();
        }

Question 5

var noHtml = Regex.Replace(inputHTML, @"<[^>]*(>|$)|&nbsp;|&zwnj;|&raquo;|&laquo;", string.Empty).Trim();

Question 6

আমি @ রাভি থাপলিয়াল এবং @ ডন রোলিংয়ের কোড ব্যবহার করেছি তবে কিছুটা পরিবর্তন করেছি। যেহেতু আমরা & nbsp টি খালি স্ট্রিংয়ের সাথে প্রতিস্থাপন করছি তবে পরিবর্তে & nbsp স্থানের সাথে প্রতিস্থাপন করা উচিত, তাই অতিরিক্ত পদক্ষেপ যুক্ত করা হয়েছে। এটি আমার জন্য কবজির মতো কাজ করেছিল।

public static string FormatString(string value) {
    var step1 = Regex.Replace(value, @"<[^>]+>", "").Trim();
    var step2 = Regex.Replace(step1, @"&nbsp;", " ");
    var step3 = Regex.Replace(step2, @"\s{2,}", " ");
    return step3;
}

সেমিকোলন ছাড়াই ব্যবহৃত & এনবিপিএস কারণ এটি স্ট্যাক ওভারফ্লো দ্বারা ফর্ম্যাট হচ্ছে।

Question 7

এই:

(<.+?> | &nbsp;)

কোনও ট্যাগের সাথে মেলে বা  

string regex = @"(<.+?>|&nbsp;)";
var x = Regex.Replace(originalString, regex, "").Trim();

তারপরে x = hello

Question 8

এইচটিএমএল ডকুমেন্টকে স্যানিটাইজ করাতে অনেক জটিল বিষয় জড়িত। এই প্যাকেজটি হয়ত সহায়তার জন্য: https://github.com/mganss/HtmlSanitizer

Question 9

এইচটিএমএল কেবলমাত্র এক্সএমএল এর মূল ফর্ম হয়। আপনি একটি এক্সএমএল ডকুমেন্ট অবজেক্টে আপনার পাঠ্যকে পার্স করতে পারবেন এবং মূল উপাদানটিতে পাঠ্যটি বের করার জন্য ইনারটেক্সট কল করুন। এটি যে কোনও আকারের সমস্ত এইচটিএমএল টেজেগুলি কেটে ফেলবে এবং & lt; এর মতো বিশেষ অক্ষরগুলির সাথেও ডিল করবে; & nbsp; সব একসাথে

Question 10

(<([^>]+)>|&nbsp;)

আপনি এটি এখানে পরীক্ষা করতে পারেন: https://regex101.com/r/kB0rQ4/1