<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:atom="http://www.w3.org/2005/Atom">
  <channel>
    <atom:link rel="self" type="application/rss+xml" href="https://researchdata.se/sv/catalogue/search.rss?freeKeyword=natural+language+processing"/>
    <link>https://researchdata.se/sv/catalogue</link>
    <title>Researchdata.se</title>
    <description>Search results</description>
    <language>sv</language>
    <item>
      <title>Dataset med annoteringar av tekniskt språk från fyra års tillståndsövervakning av pappersmaskinsindustri i norra Sverige</title>
      <description>Detta dataset består av tekniskt-språk-annoteringar från fyra års insamling från två pappersmaskiner i norra Sverige,  strukturerat som en Pandas dataframe. Samma data finns också tillgänglig som en semikolonseparerad .csv-fil. Datan består av två kolumner, där den första kolumnen motsvarar annoteringens textinnehåll, och den andra titeln. Annoteringarna är skrivna på svenska, och processade så att alla egennamn ersatts av textsträngen ’egennamn’. Varje rad motsvarar en annotering med titel.

Data behandlas i Python med:
import pandas as pd
annotations_df = pd.read_pickle("Technical_Language_Annotations.pkl")
annotation_contents = annotations_df['noteComment']
annotation_titles = annotations_df['title']</description>
      <pubDate>Thu, 21 Dec 2023 08:59:27 GMT</pubDate>
      <link>https://researchdata.se/sv/catalogue/dataset/2023-257</link>
      <guid>https://researchdata.se/sv/catalogue/dataset/2023-257</guid>
      <dc:publisher>Luleå tekniska universitet</dc:publisher>
      <dc:creator>Karl Löwenmark</dc:creator>
      <dc:creator>Fredrik Sandin</dc:creator>
      <dc:creator>Marcus Liwicki</dc:creator>
      <dc:creator>Stephan Schnabel</dc:creator>
    </item>
  </channel>
</rss>